Vorschläge

Produkte & Ressourcen

So funktioniert unser Website-Crawler

Ein Tool zum Durchsuchen von Websites, das alle Ihre Inhalte aufspürt – ganz gleich, wo diese gespeichert sind

Bieten Sie Ihren Nutzern eine hervorragende Website-Suche

Sind die Inhalte Ihrer Website in separaten Systemen isoliert und werden von verschiedenen Teams verwaltet? Der erste Schritt zu einer hochwertigen Suchfunktion auf Ihrer Website ist die Implementierung eines erstklassigen Crawling-Prozesses.

Unsere Web-Spider-Lösung kann Ihrem Unternehmen Zeit sparen und Kosten senken, da sie den Aufbau von Datenpipelines zwischen Ihren einzelnen Content-Repositorien und Ihrer Website-Suchsoftware sowie das damit verbundene Projektmanagement überflüssig macht.

Verwandeln Sie Ihre Website in strukturierte Inhalte

Sie können unserem Website-Crawler genau vorgeben, wie er vorgehen soll, damit er Ihre Inhalte korrekt interpretiert. So können Sie beispielsweise sicherstellen, dass Nutzer neben Standard-Webseiten auch nach Nachrichtenartikeln, Stellenanzeigen und Finanzberichten suchen und darin navigieren können – einschließlich Informationen, die in Dokumenten, PDF-Dateien, HTML und JavaScript enthalten sind.

Sie müssen keine Meta-Tags hinzufügen.

Sie können Ihre Inhalte extrahieren lassen, ohne zuvor Meta-Tags zu Ihrer Website hinzufügen zu müssen. Unser Webcrawler ist nicht auf benutzerdefinierte Metadaten angewiesen. Stattdessen stellt er Ihrem technischen Team einen benutzerfreundlichen Editor zur Verfügung, mit dem Sie festlegen können, welche Inhalte extrahiert werden sollen und wie diese strukturiert werden sollen.

Bereichern Sie Ihre Inhalte, um sie relevanter zu gestalten

Um die Relevanz der Suchergebnisse für Ihre Nutzer zu verbessern, können Sie Ihre extrahierten Inhalte mit Geschäftsdaten aus dem Web anreichern, unter anderem aus Google Analytics und Adobe Analytics. Mit dem Algolia Crawler können Sie Daten zum Besucherverhalten und zur Seitenleistung nutzen, um Ihre Suchmaschinenplatzierungen zu optimieren, Ihren Inhalten Kategorien zuzuweisen und so eine erweiterte Navigation zu ermöglichen und vieles mehr.

Passen Sie das Crawling nach Bedarf an

Automatische Crawling-Sitzungen planen

Sie können unser Website-Crawler-Tool so konfigurieren, dass es Ihre Webdaten nach einem festgelegten Echtzeit-Zeitplan auswertet, beispielsweise jeden Abend um 21 Uhr, mit einem erneuten Crawling am nächsten Tag um 12 Uhr mittags.

Eine Crawling-Aufgabe manuell einrichten

Bei Bedarf können Sie das Crawling eines bestimmten Bereichs Ihrer Website oder sogar der gesamten Website manuell auslösen.

Sag ihm, wo er hingehen soll

Sie können festlegen, welche Teile Ihrer Website bzw. welche Webseiten von unserem Web-Spider gecrawlt (oder ausgelassen) werden sollen, oder Sie können ihn automatisch überall crawlen lassen.

Berechtigung erteilen

Konfigurieren Sie unseren Crawler so, dass er durch Passwort geschützte Seiten durchsucht und indexiert.

Halten Sie Ihre durchsuchbaren Inhalte auf dem neuesten Stand

URL-Inspektor

Auf der Registerkarte „Inspector“ können Sie alle Ihre gecrawlten URLs einsehen und überprüfen und dabei feststellen, ob der jeweilige Crawl erfolgreich war, wann er abgeschlossen wurde und welche Datensätze dabei generiert wurden.

Überwachung

Auf der Registerkarte „Überwachung“ können Sie die Details zum letzten Crawling einsehen und die gecrawlten URLs nach Status (erfolgreich, ignoriert, fehlgeschlagen) sortieren.

Datenanalyse

Auf der Registerkarte „Datenanalyse“ können Sie die Qualität des von Ihrem Webcrawler erstellten Index überprüfen und feststellen, ob bei einigen Datensätzen Attribute fehlen.

Pfad-Explorer

Auf der Registerkarte „Path Explorer“ können Sie sehen, welche Pfade der Crawler bereits durchsucht hat; für jeden Pfad wird angezeigt, wie viele URLs gecrawlt wurden, wie viele Datensätze extrahiert wurden und wie viele Fehler während des Crawling-Vorgangs aufgetreten sind.

Die fortschrittlichsten Unternehmen experimentieren täglich mit dem Crawler

„Wir haben erkannt, dass die Suchfunktion eine Kernkompetenz des LegalZoom-Unternehmens sein sollte, und wir betrachten Algolia als ein umsatzgenerierendes Produkt.“
 

Mrinal Murari

Teamleiter für Tools und Senior-Softwareentwickler bei LegalZoom

Empfohlene Inhalte

Was ist ein Webcrawler?

Was ist ein Webcrawler?

Ein Webcrawler ist ein Bot – also ein Softwareprogramm –, der eine oder mehrere Websites systematisch besucht und die dort gefundenen Daten erfasst.

30 Tage, um die Leistung unseres Crawlers um 50 % zu steigern

30 Tage, um die Leistung unseres Crawlers um 50 % zu steigern

In diesem Artikel geht es darum, wie wir die internen Abläufe unseres App-Crawlers überarbeitet, nach Engpässen gesucht und Aufgaben gestrafft haben, um die Verarbeitung dieser komplexen parallelen und verteilten Software zu optimieren.

Algolia-Crawler

Algolia-Crawler

Ein Überblick darüber, was der Algolia-Crawler für Ihre Website leisten kann.

Häufig gestellte Fragen zum Website-Crawler

Jeden in die Lage versetzen, hervorragende Such- und Entdeckungsfunktionen zu entwickeln