Claude-lækage afslører kritisk SEO-fejl: Derfor er robots.txt ikke nok
For nylig kom det frem, at tusindvis af private samtaler fra AI-tjenesten Claude var blevet indekseret af Google. Sagen er ikke blot en påmindelse om datasikkerhed i AI-alderen, men fungerer også som et skoleeksempel på en af de mest sejlivede misforståelser inden for teknisk SEO: forskellen på “disallow” i robots.txt og et rigtigt “noindex”-tag.
Problemet opstod, da brugere delte links til deres Claude-chats offentligt. Selvom Anthropic, virksomheden bag Claude, havde forsøgt at blokere søgemaskinerne via deres robots.txt-fil, dukkede samtalerne alligevel op i søgeresultaterne. Det skyldes en fundamental fejl i forståelsen af, hvordan Google håndterer direktiver. Når vi arbejder med moderne søgemaskineoptimering, er det afgørende at forstå, at robots.txt udelukkende er en anmodning om ikke at besøge (crawle) en side – det er ikke en garanti mod, at siden bliver vist i Google.
Forskellen på at crawle og at indeksere
Mange SEO-specialister og udviklere begår den fejl at tro, at hvis Google ikke må crawle en side, så kan den heller ikke findes af brugere. Men sandheden er en anden. Hvis en URL er blokeret via robots.txt, men modtager et link fra et andet sted på nettet, kan Google vælge at indeksere URL’en alligevel. Google ved nemlig, at siden eksisterer, selvom de ikke har tilladelse til at læse selve indholdet.
I tilfældet med Claude resulterede det i søgeresultater, hvor titlen ofte var linket til chatten, selvom Google ikke nødvendigvis havde fuld indsigt i teksten. For en virksomheds SEO-strategi betyder det, at følsomme sider, login-sider eller midlertidige kampagnesider risikerer at blive synlige for offentligheden, hvis man kun læner sig op ad robots.txt.
Lektionen fra Anthropic: Sådan beskytter du dit indhold
For at sikre, at specifikt indhold aldrig optræder i Googles indeks, skal man benytte et “noindex”-direktiv. Dette kan enten gøres via et meta-tag i HTML-koden eller via et X-Robots-Tag i HTTP-headeren. Det paradoksale er, at for at Google skal opdage et “noindex”-tag, skal søgemaskinen have lov til at crawle siden.
Hvis du både har en “disallow” i din robots.txt og et “noindex” på siden, risikerer du, at Google aldrig ser dit noindex-tag, fordi de er forment adgang til at læse siden. Den korrekte fremgangsmåde for at fjerne indhold fra Google er derfor:
- Fjern blokeringen i robots.txt midlertidigt.
- Implementér et noindex-tag på siden.
- Vent på, at Google crawler siden og fjerner den fra indekset.
- Genindfør eventuelt blokeringen i robots.txt, hvis du vil spare på dit crawl-budget.
Denne sag understreger vigtigheden af teknisk SEO som en disciplin, der ikke kun handler om synlighed, men i høj grad også om kontrol og beskyttelse af data. For AI-virksomheder og andre platforme med brugergenereret indhold er det en dyr lærestreg i vigtigheden af korrekt indekseringsstyring.
Hvad er den vigtigste forskel på robots.txt og noindex?
Robots.txt styrer, om søgemaskiner må besøge en side (crawling), mens noindex fortæller dem, at siden ikke må vises i søgeresultaterne (indeksering). En side kan godt blive indekseret, selvom den er blokeret i robots.txt, hvis andre sider linker til den.
Hvorfor blev Claude-chats synlige på Google?
De blev synlige, fordi de var blokeret via robots.txt i stedet for noindex. Da brugere delte links til deres chats på internettet, opdagede Google disse links og indekserede URL’erne, selvom de ikke måtte crawle selve indholdet på siderne.
Hvordan fjerner man bedst følsomme sider fra Googles søgeresultater?
Den mest effektive metode er at bruge et noindex-tag i sidens -sektion. Man skal sikre sig, at siden ikke er blokeret i robots.txt, så Googles robotter rent faktisk kan læse noindex-tagget og fjerne siden fra deres system.
Kan man stole på, at robots.txt beskytter private data?
Nej, robots.txt er ikke en sikkerhedsforanstaltning. Det er en vejledning til søgemaskiner. Hvis data skal være private, bør de ligge bag et login eller som minimum være beskyttet med noindex-tags og korrekte serverindstillinger.

