Hallo!
Ich teile die offensichtlich hier vorherrschende Meinung nicht, das wenn man Inhalte ins Interweb stellt, diese dann auch gefälligst unwidersprochen jedermann (insbesondere der KI) überlassen werden solle. Für die die es interessiert; hier die ersten (vermutlich noch eher unzureichenden) Maßnahmen die ich getroffen habe.
Eine Aufstellung der (angeblich) aktuellen KI-Bots mit den jeweiligen Funktionen und eine Einschätzung, ob sie den robots.txt respektieren:
Aktuelle KI-Bot Liste
Ich habe mich entschieden erst mal nur die KI-Bots zu blocken, die meine Daten für ihr direktes Training mißbrauchen. Die KI-Assistenten (diese rufen eine URL ab, wenn ein Nutzer die KI auffordert, diese anzuzeigen) und KI-Searchbots (diese bilden den Suchindex, ähnlich Googles Suchindex, den die KI bei der Beantwortung von Anfragen konsultiert) lasse ich im Augenblick noch durch, denn natürlich möchte ich, das meine Seiten auch gefunden werden, wenn man per KI nach ihr sucht (was ja immer mehr Menschen tun).
Die wirksamste Maßnahme ist wohl das harte blocken der KIs in der .htaccess Datei. Allerdings könnten sich die KIs auch einfach beispielsweise als Browser tarnen und sich so Zugang verschaffen. Ich habe hier nur die geblockt, wo (laut obiger Liste) nicht sicher ist, ob sie die robots.txt Datei respektieren:
<IfModule mod_rewrite.c>
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} (anthropic-ai|Bytespider|cohere-ai|Diffbot|facebookexternalhit|Meta-ExternalAgent|Scrapy|Spider|TerraCotta|TikTokSpider|Timpibot|WARDBot|Webzio-Extended|webzio-extended) [NC]
RewriteRule .* - [F,L]
</IfModule>
Zusätzlich habe ich noch folgende robots.txt Datei generiert. Diese ist nicht so effizient, da sie von den Crawlern einfach ignoriert werden können. Ich habe aber – wie schon erwähnt – die leise Hoffnung, das zumindest die größeren KI-Crawler soweit »seriös« geworden sind (seriös werden mussten) das sie sich mittlerweile an die Anweisungen halten. Auch die oben erwähnte Liste deutet darauf hin…
# KI blocken
User-agent: Amazonbot
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: ClaudeBot
User-agent: FacebookBot
User-agent: FriendlyCrawler
User-agent: Google-Extended
User-agent: GPTBot
User-agent: Meta-Externalagent
User-agent: TerraCotta
Disallow: /
Dann habe ich im Antwort-Header und im <meta name "robots"> das übliche »noai« weg gelassen, weil ich nicht genau weiß, was »noai« alles blockt (falls es überhaupt irgendwas bewirkt). Wie gesagt, ich will ja auch gefunden werden. Ich bin mir auch nicht sicher, ob es sinnvoll ist beides einzusetzen…
<IfModule mod_headers.c>
Header set X-Robots-Tag "noimageai, noimageindex"
</IfModule>
<meta name="robots" content="noimageai, noimageindex">
Von der TDMREP (TDM Reservierungsprotokoll) erhoffe ich mir aktuell nicht viel und habe sie vorläufig weg gelassen:
edrlab.org
Es gibt einige KIBot-Checker zum überprüfen der Einstellungen, die aber meistens nur die robots.txt Datei prüfen und nicht die htaccess Datei. Ausserdem sind alle mehr oder weniger unvollständig. Hier die IMO brauchbarsten…
Checkt auch die htaccess Datei:
seosoon.de
Checkt nur robots.txt (unterstützt aber mehr KI-Bots):
137foundry.com
minoka.de
Einen schönen Tag noch!
Lg, Bimmelbeule