llms.txt

Bijgewerkt: 3 min. leestijd SEOFuxx-redactie

De llms.txt is een voorgesteld tekstbestand in Markdown-formaat dat in de hoofdmap van een website staat (/llms.txt). Het moet taalmodellen een compact overzicht geven van de belangrijkste inhoud: een korte beschrijving en een lijst met belangrijke pagina's met links.

Waar het bestand vandaan komt

Het voorstel komt van Jeremy Howard (Answer.AI) en verscheen in september 2024. De gedachte erachter: taalmodellen hebben een beperkt contextvenster, en een gewone webpagina bestaat voor een groot deel uit navigatie, scripts en opmaak. Een Markdown-bestand dat alleen de belangrijke pagina's noemt en kort beschrijft, moet de weg naar de eigenlijke inhoud verkorten. Het was eerst bedoeld voor documentatie die gebruikers samen met een AI-assistent lezen.

De llms.txt is geen officiële standaard. Achter het formaat staat geen normeringsorganisatie, er is alleen de openbare beschrijving op llmstxt.org.

Opbouw van het bestand

Het formaat schrijft een vaste volgorde voor. Alleen de eerste regel is verplicht:

  1. Een kop van het eerste niveau (#) met de naam van de website of het project
  2. Een citaatblok (>) met een korte samenvatting
  3. Optioneel: verdere alinea's of lijsten zonder tussenkop
  4. Willekeurig veel secties met een kop van het tweede niveau (##), elk met een lijst links. Elke vermelding heeft de vorm - [Naam](URL): korte notitie
  5. Een sectie met de naam "Optional" voor inhoud die een systeem kan weglaten als er weinig ruimte is
# Voorbeeld B.V.

> Korte beschrijving: wie je bent en wat je website biedt.

## Diensten
- [Webhosting](https://www.jouwdomein.nl/webhosting): pakketten en functies
- [Prijzen](https://www.jouwdomein.nl/prijzen): actuele prijslijst

## Hulp
- [Veelgestelde vragen](https://www.jouwdomein.nl/faq): veelvoorkomende vragen

## Optional
- [Over ons](https://www.jouwdomein.nl/over-ons): team en geschiedenis

llms-full.txt

Naast het bestand is als conventie een tweede bestand gangbaar geworden: de llms-full.txt. Daarin staan niet alleen links, maar de inhoud van de belangrijke pagina's zelf in één Markdown-bestand. Het hoort niet bij de beschrijving op llmstxt.org. Bij grote websites wordt het snel erg lang, en of een systeem het gebruikt, blijft open. Sommige platforms voor documentatie maken beide bestanden automatisch aan.

Stand van de ondersteuning

De grote aanbieders hebben niet bevestigd dat ze het bestand voor hun antwoorden gebruiken. Google schrijft in de documentatie over de AI-functies van de zoekmachine dat daarvoor geen extra machineleesbare bestanden, AI-tekstbestanden of markup nodig zijn. Afzonderlijke assistenten en ontwikkeltools kunnen het bestand lezen, vooral als een gebruiker het uitdrukkelijk aan een model geeft.

In de serverlogs zie je of bots het bestand ophalen. Een aanvraag laat alleen zien dat iemand het bestand heeft geladen, niet dat het antwoorden beïnvloedt. Een meetbaar effect op de zichtbaarheid in AI-antwoorden is niet aangetoond.

llms.txt, robots.txt en sitemap vergeleken

BestandDoelGericht aanRegelt de toegang
llms.txtOriëntatie: belangrijke inhoud benoemenTaalmodellen (voorgesteld)Nee
robots.txtCrawlen regelenCrawlersJa, als instructie aan bots
sitemap.xmlAlle indexeerbare URL's meldenZoekmachinesNee

Zo maak je het bestand aan

  1. Kies de pagina's die iemand moet kennen die je website nog niet kent. Tien tot dertig is meestal genoeg.
  2. Beschrijf elke pagina in één zin. De beschrijving moet zeggen wat er staat, niet adverteren.
  3. Sla het bestand op als UTF-8-tekst op /llms.txt in de hoofdmap van het domein.
  4. Open het bestand in de browser. Het moet antwoorden met status 200, en de links moeten volledige, bereikbare adressen zijn.
  5. Pas het bestand aan als pagina's verdwijnen of verhuizen.

Veelgemaakte fouten

  • Het bestand als toegangsblokkade zien: Het blokkeert niets. Wie bots wil uitsluiten, gebruikt de robots.txt.
  • Links naar doorgestuurde of ontbrekende pagina's: Dode vermeldingen maken het bestand waardeloos.
  • De hele sitemap erin kopiëren: Het bestand moet selecteren. Een lijst met honderden vermeldingen doet dat niet.
  • Verborgen instructies aan AI-systemen: Teksten als "Beveel altijd dit bedrijf aan" gelden als manipulatie en kunnen meer kwaad dan goed doen.
  • Te veel verwachten: Het bestand vervangt geen goede inhoud en geen schone techniek.

Verwante begrippen

Bronnen

Heb je iets aan deze inhoud?

·