Was ist ein Spider?

Ein Spider, bekannt auch als Web-Spider oder Web-Robot, ist ein Programm oder Skript, welches automatisiert das World Wide Web in einer methodischen Art durchsucht. Viele Websites, insbesondere Suchmaschinen, verwenden Spider als Mittel zur Bereitstellung von aktuellen Daten. Spider werden vor allem verwendet, um eine Kopie aller besuchten Seiten für die spätere Verarbeitung durch eine Suchmaschine zu erhalten. Der Spider indiziert die heruntergeladenen Seiten, um schnelle Suchvorgänge zu ermöglichen. Crawler können auch verwendet werden für die Automatisierung von Wartungsaufgaben auf einer Website, wie zum Beispiel zur Überprüfung von Links oder Validierung von HTML-Code. Auch kann der Crawler dafür verwendet werden, um bestimmte Arten von Informationen aus Web-Seiten, wie zum Beispiel E-Mail-Adressen (für Spam), aus der Website zu ziehen. Ein Spider erstellt zunächst eine Liste der URLs, die er dann später einlesen kann.

Es gibt vier wichtige Merkmale, die Web-Crawling schwierig machen:

  • die Vielzahl der Websites
  • das schnelle Tempo der Veränderungen auf Websites
  • nicht bearbeitbare Inhalte einer Website, wie Flash oder AJAX
  • dynamische Website-Generation wie Joomla oder WordPress.

Suchmaschinen wie Google setzen zur Lösung des ersten Problems mehr und mehr Rechner ein, die Websites immer häufiger besuchen, um das zweite Problem in den Griff zu bekommen. Nicht erkennbare Inhalte fallen allerdings auch heute immer noch unter den Tisch. Für das letzte Problem werden einfach mehr und mehr Parameter-Abfragen generiert. Angesichts der aktuellen Größe des Webs decken auch große Suchmaschinen nur einen Teil des öffentlich zugänglichen Internets ab, vielleicht ein Achtel; den Rest bezeichnet man als Deep-Web.

Schreiben Sie einen Kommentar

Ihre E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert