NIMTEG
Web Scraping & Crawler · 9 Min.

Webcrawler programmieren lassen: Ablauf und Kosten

Ein Webcrawler ist ein Programm, das Websites automatisch abruft und Daten strukturiert speichert. Was er kostet, hängt vor allem von der Quelle ab: Eine statische Seite ist in Tagen angebunden, ein geschütztes Portal mit vielen Varianten braucht Wochen.

Das Wichtigste in Kürze
  • ✓Ein Crawler-Projekt läuft in sechs Schritten: Ziel, Prüfung, Prototyp, Entwicklung, Lieferung, Betrieb.
  • ✓Der größte Kostenfaktor ist die Art der Quelle: statisches HTML, JavaScript-Anwendung oder geschützte Seite.
  • ✓Der laufende Betrieb wird oft unterschätzt. Websites ändern ihr Layout, und der Crawler muss angepasst werden.
  • ✓Vor der Entwicklung gehört eine Prüfung von robots.txt, Nutzungsbedingungen und Datenschutz.
  • ✓Fertige Scraping-Tools reichen für einfache Quellen. Eine eigene Entwicklung lohnt sich bei mehreren Quellen, Abgleich und Dauerbetrieb.

Von NIMTEG, Kiel · Aktualisiert am

Was ist ein Webcrawler?

Ein Webcrawler ist ein Programm, das Websites automatisch aufruft, den Links folgt und Inhalte ausliest. Ein Scraper ist der Teil, der aus einer abgerufenen Seite gezielt Daten herauszieht, zum Beispiel Preis, Titel und Verfügbarkeit. In der Praxis werden beide Begriffe oft gleich verwendet, und ein Projekt braucht fast immer beides.

Das Ergebnis ist ein strukturierter Datensatz: eine Tabelle, eine Datenbank oder eine Schnittstelle, aus der andere Programme lesen. Der Crawler läuft entweder einmal oder regelmäßig, etwa täglich, und meldet dann nur die Änderungen.

Wofür lassen Unternehmen einen Crawler programmieren?

  • Preisbeobachtung: Preise und Verfügbarkeit von Wettbewerbern täglich erfassen
  • Marktübersicht: Angebote aus mehreren Portalen in einer Tabelle zusammenführen
  • Leadlisten: Firmendaten aus Verzeichnissen und Impressen sammeln
  • Stellenmarkt: Ausschreibungen nach Branche und Region auswerten
  • Ausschreibungen: Vergabeportale nach passenden Aufträgen durchsuchen
  • Eigene Website: Fehlerhafte Links, fehlende Angaben und Änderungen überwachen
  • Regulatorik: Änderungen auf Behörden- und Normenseiten bemerken

Vertiefende Beiträge gibt es zu zwei dieser Fälle: Wettbewerber-Preise automatisch erfassen und Web Scraping für B2B-Leads und SEO.

Wie läuft ein Crawler-Projekt ab?

SchrittInhaltErgebnis
1. Ziel klärenWelche Felder, welche Quellen, wie oft, in welchem Format?Anforderungsliste
2. PrüfungTechnische Machbarkeit, robots.txt, Nutzungsbedingungen, DatenschutzEinschätzung und Angebot
3. PrototypAbruf einer Stichprobe aus jeder QuelleBeispieldatensatz zur Abnahme
4. EntwicklungVollständiger Abruf, Bereinigung, Dublettenprüfung, FehlerbehandlungLauffähiger Crawler
5. LieferungExport oder Anbindung an Datenbank, CRM oder TabelleDaten im Zielsystem
6. BetriebZeitplan, Überwachung, Anpassung bei Änderungen der QuelleLaufender Datenfluss

Der dritte Schritt spart am meisten Ärger. Ein Beispieldatensatz mit fünfzig Zeilen zeigt sofort, ob die Felder stimmen, ob Sonderfälle fehlen und ob das Format ins Zielsystem passt. Änderungen kosten an dieser Stelle Stunden und später Tage.

Was kostet es, einen Webcrawler programmieren zu lassen?

Die Kosten eines Crawlers ergeben sich aus dem Entwicklungsaufwand und dem laufenden Betrieb. Pauschale Preise sind unseriös, weil der Aufwand je nach Quelle um den Faktor zehn schwankt. Die folgenden Faktoren bestimmen ihn.

FaktorEinfachAufwendig
Art der QuelleStatisches HTML, klare StrukturJavaScript-Anwendung, endloses Nachladen
SchutzKeine BeschränkungenAbruflimits, Bot-Erkennung
Anzahl der QuellenEine WebsiteViele Websites mit eigenem Aufbau
DatenmengeHunderte SeitenMillionen Seiten
BereinigungFelder direkt übernehmbarEinheiten, Schreibweisen und Dubletten angleichen
AbgleichKein Abgleich nötigProdukte oder Firmen über Quellen hinweg zuordnen
HäufigkeitEinmaligStündlich mit Änderungsbericht
LieferungCSV-DateiSchnittstelle, Datenbank, CRM-Anbindung

Als grobe Orientierung für den Entwicklungsaufwand: Ein Crawler für eine einzelne, gut strukturierte Quelle ist meist in ein bis drei Arbeitstagen fertig. Eine Quelle mit JavaScript-Oberfläche und Abruflimits braucht eher ein bis zwei Wochen. Projekte mit vielen Quellen und Abgleich der Datensätze dauern mehrere Wochen. Diese Spannen sind Erfahrungswerte und kein Angebot.

NIMTEG prüft die Quellen vorab und nennt innerhalb von 48 Stunden einen schriftlichen Preis, entweder für eine einmalige Lieferung oder für laufendes Monitoring.

Was kostet der laufende Betrieb?

Ein Crawler ist kein Produkt, das man einmal kauft. Websites ändern ihr Layout, benennen Felder um oder führen neue Schutzmaßnahmen ein. Ohne Betreuung liefert ein Crawler nach einigen Monaten leere oder falsche Felder, oft ohne dass es jemand bemerkt.

  • Server: Rechenleistung und Speicher für Abruf und Datenhaltung
  • Überwachung: Automatische Prüfung, ob Felder gefüllt und Mengen plausibel sind
  • Anpassung: Korrekturen, wenn sich die Quelle ändert
  • Proxy-Dienste: Nur falls für die Quelle nötig und rechtlich vertretbar

Bei NIMTEG sind Anpassungen an übliche Layout-Änderungen im Wartungsvertrag enthalten. Das Monitoring erkennt Strukturänderungen und meldet sie, bevor falsche Daten weiterverarbeitet werden.

Fertiges Tool oder eigene Entwicklung?

Fertiges Scraping-ToolEigene Entwicklung
StartSofort, ohne ProgrammierungNach Prüfung und Entwicklung
KostenMonatliches Abo nach VolumenEinmaliger Aufwand plus Betrieb
Schwierige QuellenOft nicht möglichMöglich
Bereinigung und AbgleichBegrenztNach Bedarf
DatenstandortBeim Anbieter, oft außerhalb der EUFrei wählbar
AnbindungExport und Standard-SchnittstellenDirekt ins eigene System

Für eine einzelne, einfache Quelle und gelegentliche Abrufe reicht ein fertiges Tool. Eine eigene Entwicklung lohnt sich, wenn mehrere Quellen zusammengeführt werden, wenn die Daten dauerhaft und zuverlässig fließen müssen oder wenn sie in Deutschland bleiben sollen.

Woran erkennen Sie einen seriösen Anbieter?

  • Er prüft vor dem Angebot robots.txt, Nutzungsbedingungen und Datenkategorien und sagt auch einmal Nein.
  • Er liefert vor der Entwicklung einen Beispieldatensatz.
  • Er liest keine Login-Bereiche aus und umgeht keine technischen Sperren.
  • Er begrenzt die Abrufrate, damit die Quelle nicht belastet wird.
  • Er dokumentiert Quelle, Zeitpunkt und Rechtsgrundlage.
  • Er bietet Betrieb und Anpassung an und verschwindet nicht nach der Lieferung.

Die rechtlichen Grundlagen erklärt der Beitrag Ist Web Scraping in Deutschland legal?. NIMTEG entwickelt und betreibt Crawler für einmalige Extraktionen und laufendes Monitoring, mit Ablage in PostgreSQL, BigQuery, S3 oder per Webhook. Mehr unter Custom Crawler & Monitoring.

FAQ

Häufige Fragen

Was kostet ein Webcrawler?+

Das hängt von Quelle, Datenmenge und Häufigkeit ab. Ein Crawler für eine einfache Quelle ist in ein bis drei Arbeitstagen entwickelt, geschützte oder komplexe Quellen brauchen Wochen. NIMTEG nennt nach Prüfung der Quellen innerhalb von 48 Stunden einen schriftlichen Preis.

Wie lange dauert die Entwicklung eines Crawlers?+

Von wenigen Tagen für eine einzelne, gut strukturierte Website bis zu mehreren Wochen für Projekte mit vielen Quellen, Bereinigung und Abgleich.

In welcher Programmiersprache wird ein Crawler geschrieben?+

Meist in Python mit Bibliotheken wie Scrapy oder Playwright, alternativ in JavaScript. Die Sprache ist für Auftraggeber weniger wichtig als Wartbarkeit, Dokumentation und Überwachung.

Was passiert, wenn sich die Zielwebsite ändert?+

Der Crawler muss angepasst werden. Eine Überwachung erkennt leere Felder und auffällige Mengen. Bei NIMTEG sind Anpassungen an übliche Layout-Änderungen im Wartungsvertrag enthalten.

Ist ein Webcrawler legal?+

Das Abrufen öffentlich zugänglicher Daten ist in Deutschland grundsätzlich zulässig. Grenzen setzen Urheber- und Datenbankrecht, DSGVO, technische Schutzmaßnahmen und akzeptierte Nutzungsbedingungen.

In welchem Format werden die Daten geliefert?+

Üblich sind CSV oder Excel für einmalige Lieferungen und eine Datenbank, Schnittstelle oder ein Webhook für laufende Abrufe. NIMTEG liefert unter anderem als CSV, in PostgreSQL oder über eine REST-Schnittstelle.

Veröffentlicht: 7. Oktober 2026 · Aktualisiert: 7. Oktober 2026 · NIMTEG, Kiel

Reden wir 30 Minuten — kostenlos und unverbindlich.

Sie schildern, was Sie brauchen. Wir sagen ehrlich, ob wir passen — und Sie bekommen innerhalb von 48 Stunden ein klares Angebot.