De beste combinatie: vindbaar blijven in zoekresultaten én voorkomen dat AI hiermee wordt getraind

Bryan Becker

13 minuten leestijd

Dit artikel is ook beschikbaar in English en Deutsch.

Zonder de juiste instellingen staan website-eigenaren al geruime tijd voor een lastige afweging: toestaan dat hun content voor het trainen van AI wordt gebruikt, of het risico lopen dat hun website minder goed vindbaar wordt door zoekmachines. Die afweging bestaat, omdat enkele van de grootste organisaties op het internet crawlers voor gemengd gebruik inzetten: één enkele crawler die zowel voor zoekopdrachten als voor AI-training wordt ingezet. Als je de ene afwijst, wijs je ook de andere af.

Vandaag kondigt Cloudflare een nieuwe Disallow AI Training-instelling aan, waarmee je eenvoudig in de zoekresultaten geïndexeerd kunt blijven, terwijl je tegelijkertijd voorkomt dat diezelfde crawler je content voor AI-training gebruikt. Apple, Google en Microsoft houden zich al aan deze instelling of hebben toegezegd (binnen een bepaalde termijn) zich hieraan te zullen gaan houden.

Crawlers voor gemengd gebruik vormden het moeilijkste onderdeel van de trainingsvraag, gevolgd door 'AI Summaries'. Een algemeen ‘ja’ of ‘nee’ voor de hele website is te simplistisch: hoeveel van je content in een samenvatting wordt weergegeven if even belangrijk als de vraag of de content überhaupt wordt weergegeven. Een opt-out voor 'AI Summaries' is al een van de eisen die we aan operators van crawlers voor gemengd gebruik hebben gesteld. Ons doel is om je begin volgend jaar de mogelijkheid te bieden zelf te bepalen hoeveel van jouw content wordt opgenomen — dit stel je één keer in op Cloudflare, in plaats van afzonderlijk bij elke operator.

Waarom vragen niet volstaat

De meeste website-eigenaren willen graag vindbaar zijn: door mensen, zoekmachines en (goede) bots. Maar een aanzienlijk deel van het open internet wordt gefinancierd door reclame, abonnementen of directe relaties met bezoekers, en die modellen leveren pas inkomsten op als er daadwerkelijk iemand op de site terechtkomt.

Vrijwel elke website-eigenaar beschouwt de zoekfunctie als nuttig: minder dan 1% van de Cloudflare-websites kiest ervoor om Search-bots te blokkeren. AI-training is echter een ander verhaal: 17% van de websites kiest ervoor om een mechanisme in te schakelen waarmee AI-training wordt geblokkeerd. Dit is precies de reden waarom we hebben besloten om website-eigenaren gerichte instellingen te bieden, in plaats van een standaard 'AI blokkeren' die voor iedereen hetzelfde is.

Een robots.txt-richtlijn op zich kan dit probleem niet oplossen. Iedereen kan er één publiceren, maar hiermee kan niet worden vastgesteld wie er crawlt, waarom er wordt gecrawld, of een crawler worden tegengehouden die de richtlijn negeert.

Een netwerk kan dit echter wel oplossen: we plaatsen de instelling, stellen vast wie er crawlt, classificeren waarom ze crawlen en blokkeren de crawlers die de richtlijn negeren – waarna we rapporteren wat elke operator daadwerkelijk doet op Radar.

Maar door te blokkeren wordt een crawler verwijderd. Het verandert niets aan het gedrag van crawlers. Het zou beter zijn als operators je niet dwingen om een keuze te maken. Sinds juli hebben we rechtstreeks contact met hen opgenomen. De reacties waren bemoedigend: bijna iedereen was het erover eens dat website-eigenaren zeggenschap en inzicht moeten hebben in de manier waarop hun content wordt gebruikt, en de zekerheid moeten krijgen dat hun wensen worden gerespecteerd. Om website-eigenaren te helpen dat te begrijpen, hebben we een aanduiding bedacht: 'Accountable'.

De aanduiding ‘Accountable’ erkent zowel de functies die op dit moment beschikbaar zijn als concrete toezeggingen om deze te ontwikkelen. Om voor deze aanduiding in aanmerking te komen, moet een bot-operator aan de volgende eisen voldoen of zich daartoe verbinden:

  1. Een mechanisme waarmee website-eigenaren zich voor AI-training kunnen afmelden via robots.txt of een vergelijkbare standaard.
  2. Een mechanisme waarmee website-eigenaren zich rechtstreeks bij de operator voor 'AI Summaries' kunnen afmelden, dat volgend jaar op Cloudflare zal worden geactiveerd (zie hieronder voor meer informatie).
  3. Inzicht op URL-niveau in welke pagina’s beschikbaar zijn gesteld voor training, samen met statistieken die laten zien hoe de content in de zoekresultaten werd weergegeven.
  4. De verzekering dat het weigeren van AI-training geen invloed op de traditionele zoekresultaten zal hebben.

Apple, Google en Microsoft hebben al aangetoond dat ze aan de criteria voor de aanduiding 'Accountable' voldoen. Elk van deze bedrijven combineert de functies die nu al beschikbaar zijn met tijdsgebonden toezeggingen voor de functies die nog worden ontwikkeld. Hieronder staat meer informatie over de crawlers van elk van deze bedrijven.

Nieuwe opties voor beveiligingsinstellingen

Cloudflare classificeert bots op basis van hun gedrag, en één bot kan meer dan één gedrag vertonen. Er zijn drie gedragingen die in- of uitgeschakeld kunnen worden:

  • Search - crawlen om een zoekindex op te bouwen.
  • Training - crawlen om een model te trainen of te verfijnen.
  • Agent - door gebruikers aangestuurde agents die namens een mens een pagina bezoeken, zoals chat-fetch-bots en agents die een browser gebruiken.

Een crawler voor gemengd gebruik is een crawler die zowel voor 'Search'- als voor 'Training'-functies wordt ingezet. Zonder gerichte instellingen leidt die combinatie tot de hierboven beschreven afweging: eigenaren van websites kunnen het ene gebruik niet weigeren zonder ook het andere te weigeren.

Om te voorkomen dat Accountable-crawlers voor gemengd gebruik — die de website-eigenaren niet voor deze afweging stellen — worden geblokkeerd, introduceren we een nieuwe instelling: 'Disallow Ai Training'. 'Disallow AI Training' is vernoemd naar de Disallow:-richtlijn die in je robots.txt wordt geplaatst.

De instelling ‘Block’ heeft nu een andere betekenis

De opties 'Block' en 'Block on pages with ads' waren voorheen niet van toepassing op crawlers voor gemengd gebruik, omdat deze instellingen ook de vindbaarheid in zoekresultaten konden beïnvloeden. Dankzij de nieuwe instelling 'Disallow AI Training', zijn de opties 'Block' en 'Block on pages with ads' van toepassing op alle trainingscrawlers, inclusief crawlers voor gemengd gebruik.

De instellingen voor 'Training', 'Search' and 'Agent' worden op domeinniveau toegepast. Met inbegrip van ‘Disallow AI Training’ zijn de beschikbare instellingen als volgt:

  1. Allow: alle crawlers zijn toegestaan, tenzij ze door een andere instelling of een WAF-regel worden geblokkeerd.
  2. Disallow AI Training: Bot Preference Sync plaatst de toepasselijke instelling in robots.txt. 'Accountable' crawlers voor gemengd gebruik blijven toegestaan voor het doorzoeken van websites. Alle andere trainingscrawlers worden geblokkeerd, inclusief de crawlers die uitsluitend voor trainingsdoeleinden worden gebruikt door Amazon, Anthropic, Meta en OpenAI — het blokkeren van deze crawlers heeft geen invloed op de zoekresultaten. 'Disallow AI Training' is alleen beschikbaar als instelling voor 'Training', niet voor 'Search' of 'Agent'.
  3. Block on pages with ads: crawlers, inclusief crawlers voor gemengd gebruik, worden alleen geblokkeerd op pagina’s waarvan is vastgesteld dat er een advertentie wordt weergegeven.
  4. Block: alle crawlers, inclusief crawlers voor gemengd gebruik, worden geblokkeerd.

'Disallow AI Training' werkt door een voorkeur in het bestand robots.txt te plaatsen. Een voorkeur voor uitsluitend advertenties kan op die manier niet worden aangegeven: Cloudflare kan wel detecteren op welke pagina’s advertenties worden weergegeven, maar die lijst is te groot en verandert te vaak om in robots.txt op te nemen. Daarom is er geen 'Disallow AI Training' voor pagina's met advertenties.

Agents zorgen niet voor dezelfde afweging tussen vindbaarheid en zoekbaarheid als crawlers voor gemengd gebruik, en er bestaat op het internet nog geen vastomlijnde richtlijn voor het aangeven van weigeringsvoorkeuren ('Disallow') aan agents. Momenteel gebruiken we de 'Disallow'-instelling niet voor Agents. Naarmate de standaarden zoals ai-prefs verder worden uitgewerkt, zullen we deze aanpak opnieuw onderzoeken.

Wat verandert er op 15 september?

We voeren de volgende wijzigingen door in Bot Management en AI Crawl Control:

  1. De instellingen 'Block' en 'Block on pages with ads' zijn nu van toepassing op crawlers voor gemengd gebruik, waaronder Applebot, Bingbot en Googlebot, zodat beide instellingen zowel invloed hebben op 'Search' als op 'Training'. Gebruik 'Disallow AI Training' om de training te stoppen en de zoekfunctie te behouden.
  2. 'Block AI Bots' zal worden afgeschaft ten gunste van de meer specifieke instellingen voor 'Search', 'Training' en 'Agent'.
  3. Managed Robots.txt wordt afgeschaft en vervangen door Bot Preference Sync. Klanten die 'Managed Robots.txt' hebben ingeschakeld, zullen naar het nieuwe systeem worden overgezet.
  4. 'Disallow AI Training' wordt onderdeel van de aanbevolen configuratie voor bepaalde nieuwe domeinen.
  5. De voorkeuren van bestaande klanten worden overgezet naar de nieuwe instellingen, zoals hieronder staat beschreven.

Wat je moet doen

Niets, in nagenoeg alle gevallen. Je huidige instellingen worden automatisch overgezet.

Als je wilt dat crawlers voor gemengd gebruik helemaal verdwijnen, moet je dat nu aangeven. Selecteer 'Block'. Hierdoor kunnen Applebot, Bingbot en Googlebot je website niet meer bereiken — ook niet via de zoekfunctie.

Bestaande domeinen die de instellingen Search/Training/Agent nooit hebben gebruikt

Website-eigenaren die de meer specifieke instellingen nooit hebben geconfigureerd, worden overgezet naar de nieuwe instellingen op basis van hun oude instelling 'Block AI Bots':

(Oud)
'Block AI'-instelling
(Nieuw)
'Search'-instelling
(Nieuw)
'Training'-instelling
(Nieuw)
'Agent'-instelling
Disabled Allow Allow Allow
Block Allow Disallow AI Training Block on pages with ads
Block on pages with ads Allow Disallow AI Training Block on pages with ads

Bestaande domeinen met bestaande instellingen voor 'Search' 'Training' en 'Agent'

Voor domeinen waarvoor de specifieke instellingen al eerder waren geconfigureerd, wordt het praktische effect van de gemaakte keuzes volgens de nieuwe definities gehandhaafd. De eerdere instellingen voor 'Training' of 'Block' of 'Block on pages with ads' worden overgezet naar 'Disallow AI Training'.

Instellingen Eerdere instelling Nieuwe instelling
Search Allow Allow
Block Block
Block on pages with ads Block on pages with ads
Training Allow Allow
Block Disallow AI Training
Block on pages with ads Disallow AI Training
Agent Allow Allow
Block Block
Block on pages with ads Block on pages with ads

Aanbevelingen voor nieuwe domeinen

Vanaf 15 september krijgen klanten die een nieuw domein aanmaken de keuze uit twee vooraf ingestelde configuraties, afhankelijk van het feit of de website al dan niet inkomsten uit advertenties genereert. De advertentie-inkomsten worden alleen gegenereerd als iemand de pagina daadwerkelijk bekijkt. 'Training' vervangt dat bezoek door een antwoord; agents halen de pagina op zonder dat iemand de advertenties ziet. De standaardinstellingen voor websites met advertenties zijn dus strenger. Je kunt al deze instellingen tijdens de onboarding of op elk moment daarna aanpassen.

Instelling Website genereert geen inkomsten met advertenties Website genereert inkomsten met advertenties
Preference Sync Enabled Enabled
Search Allow Allow
Training Allow Disallow AI Training
Agent Allow Block on pages with ads

Aanbevolen instellingen voor nieuwe domeinen.

BLOG-3499 2.png
Screenshot of onboarding flow for a new domain, showing the recommended settings when “I monetize pages that serve ads” is selected.

Wat betekent dit voor specifieke crawlers voor gemengd gebruik?

Applebot, Bingbot en Googlebot zijn 'Accountable'. Apple, Google en Microsoft zetten zich in voor dezelfde beginselen van keuzevrijheid voor uitgevers en transparantie. Als ‘Disallow Ai Training’ is geactiveerd, kunnen ze je site blijven crawlen om zoekresultaten te verkrijgen. Als je ‘Block’ selecteert, worden ze volledig geblokkeerd.

We classificeren ook de relevante crawlers van Amazon, Anthropic, Meta en OpenAI als ‘Accountable’. Deze organisaties houden hun zoek- en trainingscrawlers gescheiden, zodat Cloudflare de trainingscrawler kan blokkeren zonder dat dit gevolgen heeft voor de zoekfunctie.

Applebot

Met Applebot kunnen website-eigenaren 'Training' weigeren door een 'Disallow'-regel voor 'Applebot-Extended' aan het robots.txt-bestand toe te voegen. Website-eigenaren kunnen momenteel ook hun voorkeur voor 'AI Summaries' aangeven via hun nosnippet-richtlijn in de HTML-code van de pagina. De content kan ook worden gemarkeerd als 'content achter een betaalmuur' om deze van de generatieve output uit te sluiten. Applebot biedt nog geen tool voor inspectie op URL-niveau. We hebben echter een ontmoeting gehad met hun team, en zij hebben ons informatie gegeven over de oplossing waaraan ze momenteel werken die voor volgend jaar staat gepland. Apple heeft ook verklaard dat het weigeren van 'Training' geen invloed heeft op de zoekresultaten.

Googlebot

Met Googlebot kunnen website-eigenaren 'Training' weigeren door een 'Disallow'-regel voor 'Google-Extended' aan het robots.txt-bestand toe te voegen. Daarnaast wordt in hun webmasterportal een instelling aangeboden waarmee de content van een website van de generatieve zoekresultaten kan worden uitgesloten. Googlebot biedt website-eigenaren ook statistieken en rapportages over zoekresultaten en 'AI Summaries'. Google heeft informatie gedeeld over hun bestaande en onlangs gelanceerde beheersfuncties, evenals informatie over waar ze momenteel aan werken, waaronder aanvullende transparantietools op URL-niveau voor website-eigenaren in het kader van 'Google-Extended', die naar verwachting in de komende weken zullen worden gepresenteerd. Google heeft ook verklaard dat het uitschakelen van 'Google-Extended' geen invloed heeft op de zoekresultaten.

Bingbot

Bingbot biedt specifieke instellingen en transparantie in hun Webmaster Tools. Website-eigenaren kunnen momenteel hun voorkeuren voor AI-training aangeven via de NOARCHIVE-metatag van Bing. Microsoft breidt deze mogelijkheden uit en werkt momenteel aan een mechanisme om ook de voorkeur 'geen Training' in het robots.txt-bestand op domein- of siteniveau te respecteren; de beoogde startdatum is begin 2027. Cloudflare-klanten die vandaag 'Training' willen weigeren in Bing, kunnen naast het gebruik van de tag NOARCHIVE ook gebruikmaken van de Block URLs of Content Removal tool. Microsoft heeft ook verklaard dat het gebruik van NOARCHIVE geen invloed heeft op de zoekresultaten.

Zolang die ondersteuning nog niet beschikbaar is, wordt door het selecteren van 'Disallow AI Training' niet automatisch via robots.txt aan Bing doorgegeven dat 'Training' wordt geweigerd. Dit is hetzelfde gedrag in de praktijk als bij de vorige 'Training Block'-instelling, die niet van toepassing was op crawlers voor gemengd gebruik, zoals Bingbot.

Voortdurende vooruitgang

We zullen contact blijven opnemen met alle operators van AI-crawlers en met hen blijven samenwerken terwijl deze functies zich verder ontwikkelen. Cloudflare Radar houdt openbaar bij welke instellingen, transparantie en rapportagemogelijkheden de exploitanten van 'Accountable'-crawlers bieden. 

Als we willen dat het internet beter wordt, moeten beide partijen zeggenschap hebben: crawlers moeten toegang hebben tot het open web, en de mensen die dat web creëren, moeten daadwerkelijke zeggenschap hebben over hoe hun werk wordt gebruikt. De aankondiging van vandaag betekent een concrete stap in de richting van dat evenwicht.

Voor echte vooruitgang moeten infrastructuuraanbieders, content creators, technologiebedrijven en normalisatie-instanties zoals de Internet Engineering Task Force (IETF) met elkaar samenwerken om deze principes in open, compatibele normen om te zetten.

Volgende stap: 'AI Summaries'

'Training' en 'AI Summaries' roepen verschillende vragen bij website-eigenaren op. Bij 'Training' gaat het erom of de content kan worden gebruikt om AI-modellen te bouwen. 'AI Summaries' beïnvloeden hoe mensen een bedrijf ontdekken, evalueren en uiteindelijk bezoeken. Beide zijn belangrijk, maar hebben andere gevolgen voor bedrijven.

De weigeringsopties voor 'AI Summaries' zijn de eerste stap. De operators die als 'Accountable' zijn aangemerkt, bieden die mogelijkheid al aan of zijn ermee bezig, en dat is een belangrijk uitgangspunt: website-eigenaren kunnen "nee" zeggen.

Maar een globale keuze tussen het toestaan of verbieden van samenvattingen is nog steeds een grof instrument. De juiste beslissing hangt af van de website, de content en het bedrijfsresultaat. Voor uitgevers roept 'Training' fundamentele vragen op over zeggenschap, vergoeding en de duurzaamheid van originele content. 'AI Summaries' zorgen voor een aparte en vaak meer directe distributiekwestie: bezoekt iemand de website van de uitgever, of krijgt hij of zij het antwoord te zien via een zoekopdracht of een AI-ervaring? Voor veel andere bedrijven vormen 'AI Summaries' in toenemende mate een schakel tussen een potentiële klant en een website. De samenvattingen kunnen een vraag beantwoorden, alternatieven met elkaar vergelijken, een product aanbevelen of iemand helpen beslissen of een bezoek aan een website de moeite waard is.

Uit de gegevens blijkt dat de gevolgen daarvan gemengd zijn. Meer dan de helft van de consumenten leest samenvattingen in Search, en van die consumenten is meer dan 40% geneigd om na het lezen van een samenvatting hun zoekopdracht te beëindigen. Dit kan ertoe leiden dat een website minder bezoekers ontvangt. Maar consumenten die via AI Search worden doorgestuurd, converteren drie tot ruim vijf keer vaker dan degenen die via traditionele zoekresultaten zijn doorgestuurd. AI zorgt wellicht voor minder bezoekers, maar stuurt wel klanten die veel meer koopintentie hebben.

Dat is op zich niet goed of slecht. Een uitgever die zich met advertentie-inkomsten financiert, kan zich richten op het vergroten van het bereik. Een retailer geeft wellicht de voorkeur aan minder bezoekers die meer geneigd zijn om iets te kopen. Het is niet de taak van Cloudflare om deze keuze voor website-eigenaren te maken, maar om hen het nodige inzicht en de instellingen te bieden om een weloverwogen beslissing te kunnen nemen.

Opt-outs voor 'AI Summaries' zijn een goed begin, maar ze zijn niet het einddoel. Ons volgende doel is om website-eigenaren te helpen begrijpen welke invloed 'AI Summaries' op hun bedrijf hebben om hen meer zeggenschap te geven over de mate waarin hun content mag worden gebruikt. Open standaarden zoals ai-prefs spelen daarbij een belangrijke rol.

Als je graag je mening wilt uiten in deze discussie of feedback wilt geven, neem dan contact op via crawlercontrols@cloudflare.com.

Deze nieuwe instellingen zijn beschikbaar voor alle klanten, ongeacht hun abonnement, en kunnen worden geconfigureerd via de Security Settings op domein/zone-niveau. Nog geen klant van Cloudflare? Begin vandaag gratis met het instellen van de door jou gewenste regels.