Was llms.txt kann — und was sie nicht kann
Kurz gesagt: `llms.txt` ist eine Markdown-Datei im Root eurer Website mit einer kuratierten Liste wichtiger Seiten — eine Orientierungshilfe für KI-Systeme, kein Regelwerk. Es gibt in ihr kein Feld, das Crawling, KI-Training oder die Nutzung eurer Inhalte erlaubt oder verbietet, auch keinen Crawl-Delay und keine Attributionspflicht. Wer steuern will, was KI-Crawler dürfen, braucht `robots.txt`.
*Stand dieser Prüfung: 2. September 2026. Quelle: llmstxt.org.*
Woher llms.txt kommt
`llms.txt` ist ein Vorschlag von Jeremy Howard, veröffentlicht im September 2024 auf llmstxt.org. Sie ist kein Standard von IETF oder W3C — kein Gremium hat sie verabschiedet, und kein KI-System ist verpflichtet, sie überhaupt zu lesen.
Was die Datei enthält
Eine `llms.txt` liegt als reines Markdown im Root der Website (`https://deine-domain.de/llms.txt`) und enthält typischerweise: den Namen der Website, eine kurze Zusammenfassung, und eine kuratierte Liste der wichtigsten Seiten mit kurzen Notizen dazu. Sie soll KI-Systemen helfen, sich schneller zu orientieren, wenn sie eure Inhalte lesen — eher eine Sitemap für Sprachmodelle als ein Regelwerk.
# UnitedCreation
> Marketing- und KI-Agentur aus Karlsruhe: Strategie, Marke und KI-Infrastruktur aus einer Hand.
## Wichtige Seiten
- [Sichtbarkeit in KI-Antworten](/sichtbarkeit/): Visibility Blueprint und Audit
- [Insights](/insights/): Wissensbeiträge zu KI-Marketing und GEODer Unterschied zu robots.txt
Das ist die eigentlich wichtige Unterscheidung — die Verwechslung ist verbreitet:
`robots.txt` | `llms.txt` | |
|---|---|---|
Zweck | Crawling erlauben/verbieten | Orientierungshilfe, kuratierte Seitenliste |
Format | Eigenes Regelformat (`User-agent`, `Allow`, `Disallow`) | Markdown |
Steuert Zugriff? | Ja — von klassischen Suchmaschinen und vielen KI-Crawlern respektiert | Nein — keine Allow/Disallow-Syntax vorgesehen |
Ort | `/robots.txt` | `/llms.txt` |
`robots.txt` mit User-Agent-Regeln bleibt der Weg, um KI-Crawlern den Zugriff zu verwehren — und zwar für die Crawler, die solche Regeln überhaupt respektieren. Die großen Anbieter dokumentieren ihre eigenen Verfahren dazu, etwa OpenAI für `GPTBot`. Wo Inhalte wirklich nicht erreichbar sein sollen, braucht es Authentifizierung oder eine Sperre auf Netzwerkebene — keine Textdatei ersetzt das.
# robots.txt — steuert tatsächlich Zugriff
User-agent: GPTBot
Disallow: /
User-agent: *
Allow: /Wann sich llms.txt trotzdem lohnt
Als Steuerungsinstrument bringt `llms.txt` nichts. Als kuratierte Orientierung kann sie aber helfen, wenn eine Website groß oder unübersichtlich ist und ihr KI-Systemen zeigen wollt, welche Seiten fachlich am relevantesten sind — ähnlich wie eine gute interne Verlinkung das für Menschen tut. Der Effekt ist ein Hinweis, keine Garantie: Ob und wie ein KI-System die Datei nutzt, entscheidet das System, nicht die Datei.
Einrichtung
Datei erstellen: Plain-Markdown-Datei `llms.txt` mit Websitename, Zusammenfassung und Seitenliste.
Hochladen ins Root-Verzeichnis: `https://deine-domain.de/llms.txt` — bei Astro/Next.js in `/public/llms.txt`, bei WordPress meist `/public_html/` oder `/www/`.
Testen: Im Browser `https://deine-domain.de/llms.txt` öffnen — muss ohne 404 und ohne Login-Schutz erreichbar sein.
Aktuell halten: Bei größeren URL- oder Strukturänderungen die Seitenliste nachziehen — eine veraltete `llms.txt` verwirrt mehr, als sie hilft.
Häufige Fragen zu llms.txt
Ist llms.txt dasselbe wie robots.txt? Nein. `robots.txt` steuert, was Crawler dürfen. `llms.txt` ist eine Orientierungsliste ohne Steuerungsfunktion. Beide können parallel existieren.
Kann ich mit llms.txt KI-Training verbieten oder Attribution einfordern? Nein. Es gibt in der Spezifikation kein Feld dafür. Zugriff steuert ihr über `robots.txt`, über die Verfahren, die die Anbieter selbst dokumentieren, und — wo Inhalte wirklich geschützt sein müssen — über Login oder Sperren auf Netzwerkebene.
Ist llms.txt ein offizieller Standard? Nein. Sie ist ein Vorschlag von Jeremy Howard (September 2024, llmstxt.org), kein Standard von IETF oder W3C.
Was passiert, wenn ich keine llms.txt setze? Nichts an eurer Zugriffssteuerung ändert sich — die regelt weiterhin ausschließlich `robots.txt`. Ihr verzichtet lediglich auf die optionale Orientierungshilfe für KI-Systeme.
Zusammenfassung
`llms.txt` ist eine kuratierte Seitenliste für KI-Systeme — nützlich als Orientierung, wirkungslos als Zugriffssteuerung. Wer Crawling oder Training tatsächlich steuern will, braucht `robots.txt` und die Verfahren der jeweiligen Anbieter.
In der Praxis bei UC: Mit unserem RankPilot prüfen wir, welche Seiten KI-Crawler tatsächlich abgreifen und wie eine Marke in KI-Antworten tatsächlich vorkommt — das zeigt mehr über eure Sichtbarkeit als eine einzelne Datei im Root. Wer wissen will, wo die eigene Sichtbarkeit in KI-Antworten aktuell steht, findet den Einstieg im Visibility Blueprint.
Wenn ihr wissen wollt, wie `robots.txt` und `llms.txt` für eure Website sinnvoll zusammenspielen:
Frage zum Thema? Stellt sie hier →