AI Crawlers Directory

Every AI crawler we check — who runs it, what it does, and whether you should allow it. 40 crawlers across three jobs.

Retrieval / search crawlers 12

Build the index AI answers cite from. Blocking these removes you from AI answers — the expensive mistake.

OAI-SearchBot

ChatGPT Search retrieval; blocking removes you from ChatGPT answers

OAI-AdsBot

ChatGPT ads landing-page validation

Claude-SearchBot

Claude answer retrieval; blocking stops Claude from citing you

PerplexityBot

Perplexity indexing + live retrieval with citation backlinks; blocking is costly

Googlebot

Google's main search crawler; almost never block

Bingbot

Bing + Copilot retrieval; almost never block

Applebot

Siri / Spotlight / Safari suggestions

DuckAssistBot

DuckDuckGo AI summaries

meta-webindexer

Meta AI search index; blocking removes you from Meta AI answers

PetalBot

Petal Search / Celia assistant index

ImagesiftBot

Hive's AI image search index

iaskspider

iAsk.ai AI search engine index

User-triggered fetchers 6

Fetch a page in real time when a user opens your link in a chat. Safe to allow.

ChatGPT-User

Real-time fetch when ChatGPT users click your links

Claude-User

Real-time fetch when Claude users click your links

Perplexity-User

Perplexity user-triggered fetch (sometimes ignores robots.txt)

MistralAI-User

Real-time fetch when Le Chat users click your links

Meta-ExternalFetcher

Real-time fetch when Meta AI users open links

DeepSeek-User

Real-time fetch when DeepSeek users open links

Training / data crawlers 22

Harvest content to train models or build datasets. Blocking opts you out of training — a legitimate choice, not a visibility loss.

GPTBot

Trains GPT models; blocking opts out of training, does not affect ChatGPT citations

ClaudeBot

Trains Claude models; blocking opts out of training

anthropic-ai

Anthropic legacy training crawler

Claude-Web

Legacy Anthropic crawler (deprecated); many sites still block it explicitly

Google-Extended

Gemini training opt-out; blocking opts out of Gemini training & AI Overviews

GoogleOther

Google's generic crawler for research & datasets (not Search indexing); often blocked alongside AI bots

Applebot-Extended

Apple Intelligence training opt-out

CCBot

Open dataset feeding most open-source model training

Bytespider

Doubao / TikTok training; often ignores robots.txt

Meta-ExternalAgent

Meta AI (Llama) training & data collection

FacebookBot

Meta's older LLM training crawler (Llama datasets)

Amazonbot

Alexa / Rufus training & retrieval

cohere-ai

Cohere model training

cohere-training-data-crawler

Cohere legacy training-data crawler

Diffbot

Knowledge-graph data broker; blocking prevents content resale

MistralAI-Training

Mistral model training crawler

YouBot

you.com index + training crawler

Webzio-Extended

Commercial data broker licensing content for AI training

AI2Bot

Academic research crawler (Allen AI); builds open datasets (Dolma)

PanguBot

Huawei Pangu model training

Timpibot

Timpi independent web index (search & AI data)

DeepSeek-Bot

DeepSeek model training / data collection

Check your site against all 40 →

checkaibots.com — AI visibility checker · Free · No signup