Technische Anleitung
robots.txt für KI-Bots richtig steuern
Veröffentlicht und geprüft am · Von Metin Özkan
Mit der robots.txt veröffentlichst du Crawl-Regeln für automatisierte User-Agents. Sie ist eine Zugriffskonvention, kein zuverlässiges Werkzeug zum Entfernen bereits bekannter URLs aus Suchergebnissen.
Was robots.txt leistet – und was nicht
Die Datei liegt unter /robots.txt am Ursprung einer Website. Ein regelkonformer Crawler liest dort, welche Pfade er abrufen darf. Regeln gelten immer für den angegebenen User-Agent und den jeweiligen Host. Subdomains haben ihre eigene robots.txt.
Eine Sperre verhindert normalerweise den Abruf, nicht zwingend die Kenntnis einer URL. Für Seiten, die aus einem Suchindex verschwinden sollen, ist eine abrufbare noindex-Anweisung geeigneter. Wird die Seite gleichzeitig per robots.txt blockiert, kann der Crawler diese noindex-Anweisung nicht lesen.
Bots nach Zweck behandeln
Beginne mit einer fachlichen Entscheidung: Sollen aktuelle Suchzitate möglich sein? Dürfen Assistenten eine URL auf ausdrücklichen Nutzerwunsch abrufen? Darf der Inhalt für Training gesammelt werden? Erst danach werden die dokumentierten User-Agents der Anbieter den Zielen zugeordnet.
Bot-Listen ändern sich. Verwende deshalb eine datierte Liste mit Quellen und prüfe sie regelmäßig. Verlasse dich nicht auf einen alten Blogbeitrag oder eine kopierte Komplettliste ohne Herkunft.
- Suche und Quellen möglichst separat bewerten
- Nutzergesteuerte Agentenabrufe separat bewerten
- Training und große Datensammlungen separat bewerten
- Änderungen mit Datum und Begründung dokumentieren
Sichere Grundstruktur
Eine kurze Datei ist leichter zu prüfen als viele überlappende Regeln. Spezifische User-Agent-Blöcke können von einer allgemeinen Regel abweichen. Teste wichtige URLs gegen genau den Bot-Namen, den du steuern möchtest, und achte auf Weiterleitungen zwischen Hosts.
Eine Sitemap-Zeile hilft Suchmaschinen, die kanonische XML-Sitemap zu entdecken. Sie ersetzt keine internen Links, ist aber eine robuste zusätzliche Discovery-Quelle.
- User-agent: *
- Allow: /
- Sitemap: https://example.com/sitemap.xml
Typische Fehler und Korrektur
Ein häufiger Fehler ist Disallow: / für einen Such-Bot, obwohl nur Training unerwünscht ist. Ebenfalls problematisch sind pauschal gesperrte Verzeichnisse, in denen indexierbare Detailseiten liegen. Prüfe außerdem, ob CDN, CMS und Anwendung dieselbe Datei ausliefern.
Nach jeder Änderung rufst du /robots.txt öffentlich ab, prüfst den HTTP-Status und testest mehrere relevante URLs. Anschließend beobachtest du Crawling und Indexierung in den Webmaster-Werkzeugen der Suchmaschinen.
Häufige Fragen
Kann robots.txt eine Seite aus Google entfernen?
Nicht zuverlässig. Eine blockierte URL kann weiterhin als URL bekannt sein. Für eine Entfernung sollte Google die Seite abrufen und eine noindex-Anweisung erkennen können.
Gilt eine robots.txt für alle Subdomains?
Nein. Jede Kombination aus Schema und Host besitzt eine eigene robots.txt, zum Beispiel www.example.com und shop.example.com.
Sollte ich alle KI-Bots erlauben?
Das ist eine Betreiberentscheidung. Suche, Agentenabrufe und Training haben unterschiedliche Zwecke und können gezielt statt pauschal geregelt werden.