Hopp til innhold

Innsikt

AI-crawlere og agenter: slik leser de nettstedet ditt

Torn Studio4 min lesetid

Kort svar

AI-selskapenes roboter gjør tre ulike jobber: de trener modeller, bygger søkeindekser og henter sider for en bruker i øyeblikket. Alle de store AI-labene dokumenterer nå egne roboter for hvert formål, så trening kan blokkeres med synligheten i AI-svar i behold. Brukerhentinger ignorerer likevel som regel robots.txt, og Cloudflare innfører nye standardblokkeringer 15. september 2026.

Spørsmålet om AI-roboter skal blokkeres, har blitt tre spørsmål, for robotene gjør nå tre ulike jobber med tre ulike konsekvenser. Den som behandler dem som én beslutning, blokkerer ofte feil ting.

Hvilke roboter kommer, og hva gjør de?

OpenAI dokumenterer fire agenter: GPTBot samler treningsdata, OAI-SearchBot bygger søkeindeksen, ChatGPT-User henter sider på brukerens forespørsel, og OAI-AdsBot gransker annonser. Dokumentasjonen er direkte om konsekvensen: et nettsted som stenger ute OAI-SearchBot, vises heller aldri i ChatGPTs søkesvar, mens blokkert GPTBot bare stopper trening. Anthropic gjør samme oppdeling med ClaudeBot, Claude-SearchBot og Claude-User, og Google skiller mellom Googlebot, treningskontrollen Google-Extended og den nye agentroboten Google-Agent fra mars 2026.

Oppdelingen gjør beslutningen håndterbar: å blokkere trening og å beholde synlighet er to ulike linjer i robots.txt. Meta dokumenterer samme tredeling i sin crawlerdokumentasjon, der også søkeindeksroboten Meta-WebIndexer er dokumentert.

Følger robotene robots.txt?

Delvis, og forskjellen er dokumentert. Googles crawlerdokumentasjon oppgir at brukerutløste hentinger som regel ignorerer robots.txt fordi et menneske har bedt om siden, og OpenAI og Perplexity skriver det samme om sine motstykker. TollBits måling av fjerde kvartal 2025, omtalt av Digiday i februar 2026, fant i tillegg at 30 % av alle AI-hentinger gikk forbi robots.txt-regler, for ChatGPT-User hele 42 %. Robots.txt er en viljeserklæring; reell blokkering krever brannmur eller CDN.

Hva endres i infrastrukturen?

  • Cloudflare deler siden juli 2026 AI-trafikk inn i kategoriene søk, agent og trening, og blokkerer trening og agenter som standard for nye domener med annonser fra 15. september 2026
  • IETF-standarden for AI-preferanser, med forfattere fra Google og Mozilla, når sin siste milepæl i august 2026 med en Content-Usage-regel for robots.txt
  • Web Bot Auth lar roboter legitimere seg kryptografisk, og Google har testet protokollen for agentene sine siden mai 2026
  • Betalingsspor som Cloudflares pay-per-crawl ligger fortsatt i lukket beta, og ingen AI-gigant betaler ennå åpent via lisensstandarden RSL

Den mye omtalte filen llms.txt hører hjemme i samme nøkterne kolonne: Ahrefs undersøkte 137 000 domener i juni 2026 og fant at 97 % av filene aldri får en eneste forespørsel, og Google har gjentatt at søket ignorerer den.

Er nettstedet ditt bygget for agenter?

Agenter som utfører ærender for brukere, ble hverdag i 2026: Perplexitys Comet er gratis og finnes på iPhone, Claude kan klikke og fylle ut skjemaer via nettleseren på alle betalte planer, og Googles Gemini utfører nettoppgaver med brukerens innlogginger. Googles egen veiledning for agentvennlige nettsteder er konkret: ekte knapper og lenker i semantisk HTML, stabil layout og skjemaer med riktige etiketter, fordi agentene leser DOM, skjermbilder og tilgjengelighetstreet. Alt dette gjør nettstedet bedre for mennesker også.

Vanlige spørsmål

Hvilke AI-crawlere bør jeg slippe inn hvis jeg vil ha kunder fra AI-svar?
Søkeindeks- og brukerrobotene: OAI-SearchBot og ChatGPT-User for ChatGPT, Claude-SearchBot og Claude-User for Claude, PerplexityBot for Perplexity, samt Googlebot og bingbot. Treningsroboter som GPTBot og ClaudeBot er en egen beslutning som mangler kobling til synligheten.
Stopper robots.txt AI-robotene i praksis?
Bare de deklarerte crawlerne. Brukerutløste hentinger ignorerer som regel filen, ifølge Googles, OpenAIs og Perplexitys egen dokumentasjon, og TollBit målte at 30 % av AI-hentingene i fjerde kvartal 2025 gikk forbi reglene. Vil du virkelig stenge trafikk ute, kreves brannmur eller CDN-regler.
Kan Cloudflare begynne å blokkere AI-roboter automatisk for meg?
Ja. For nye domener og nye nettsteder med annonser blokkeres trenings- og agentroboter som standard fra 15. september 2026, mens søkeroboter slippes gjennom. Ligger nettstedet ditt bak Cloudflare, bør du kontrollere innstillingene, slik at standardvalget er et valg du faktisk har tatt.
Går det an å ta betalt når AI-selskaper leser innholdet?
Sporene finnes, men pengene er små. Cloudflares pay-per-crawl er i lukket beta, lisensstandarden RSL har infrastrukturselskaper og utgivere bak seg, men ennå ingen åpent betalende AI-gigant, og Perplexitys inntektsdeling gjelder tilknyttede utgivere. For de fleste bedrifter er synligheten fortsatt hele kompensasjonen.
Hvordan vet jeg at en bot er den den utgir seg for å være?
Kontroller avsenderen mot selskapenes publiserte IP-lister, som OpenAIs og Anthropics JSON-filer. Neste steg er kryptografisk legitimering via Web Bot Auth, som Google har testet for agentene sine siden mai 2026, og som Cloudflare allerede bruker for signerte agenter.
Tåler nettstedet besøk av AI-agenter som klikker og fyller ut skjemaer?
Test selv: kan hovedflyten på siden gjennomføres med tastatur, har knapper og lenker ekte elementer og etiketter, og ligger innholdet i ro mens siden laster? Googles veiledning for agentvennlige nettsteder faller nesten helt sammen med tilgjengelighetsarbeid, så innsatsen betaler seg dobbelt.

Kilder

  1. OpenAI bots and crawlers — OpenAI developer docs

    Dokumentasjonen av GPTBot, OAI-SearchBot, ChatGPT-User og OAI-AdsBot, og regelen om at blokkert OAI-SearchBot fjerner nettstedet fra ChatGPTs søkesvar.

  2. Does Anthropic crawl data from the web? — Anthropic Help Center

    Anthropics tredeling i ClaudeBot, Claude-SearchBot og Claude-User, med robots.txt-styring og IP-lister.

  3. Google user-triggered fetchers — Google Crawling Infrastructure

    Google-Agent og beskjeden om at brukerutløste hentinger som regel ignorerer robots.txt, oppdatert 2026-08-19.

  4. Perplexity crawlers — Perplexity docs

    PerplexityBot for søkeindeksen, og Perplexity-User som vanligvis ignorerer robots.txt ved brukerhentinger.

  5. Your site, your rules: new AI traffic options — Cloudflare

    Kategoriene søk, agent og trening, og standardblokkeringene som kommer 15. september 2026.

  6. AI licensing deals, protection measures aren’t slowing web scraping — Digiday

    TollBits måling: 30 % av AI-hentingene gikk forbi robots.txt i fjerde kvartal 2025, 42 % for ChatGPT-User.

  7. We Analyzed 137K Sites: 97% of llms.txt Files Never Get Read — Ahrefs

    Studien fra juni 2026 av 137 210 domener der 97 % av llms.txt-filene aldri fikk en forespørsel.

  8. Build agent-friendly websites — web.dev

    Googles veiledning for agentvennlige nettsteder: semantisk HTML, stabil layout og agenter som leser DOM, skjermbilder og tilgjengelighetstreet.

Fortell hva du vil bygge

Tretti minutter, kostnadsfritt, og et ærlig svar på om vi er riktig studio for oppdraget.