Was ist eine robots.txt?
Die robots.txt ist eine Textdatei am Stamm einer Website, die kooperierenden Crawlern mitteilt, welche Pfade sie abrufen dürfen oder nicht abrufen sollen.
Regeln können nach User-Agent unterschieden werden. Die Datei dient der Crawl-Steuerung, ist aber kein zuverlässiger Zugriffsschutz und entfernt Seiten nicht automatisch aus einem Suchindex. Für KI-Dienste sollten Unternehmen getrennt prüfen, welche Bots welchem Zweck dienen und welche Richtlinie gewünscht ist.
Warum relevant? Eine fehlerhafte Regel kann wichtige Inhalte blockieren; eine zu offene Konfiguration kann unnötige oder unerwünschte Abrufe ermöglichen.