Bots y crawlers de IA

Estos son los robots que leen tu web para alimentar a ChatGPT, Gemini, Perplexity y compañía. Si los bloqueas, tu negocio desaparece de sus respuestas.

¿Tu web deja entrar a estos bots?

Escribe tu dominio y te decimos qué rastreadores de IA permite o bloquea tu robots.txt. Gratis y sin registro.

58 rastreadores

OpenAIEntrenamiento
GPTBot

Recopila contenido público para entrenar los modelos de IA de OpenAI, como los que usa ChatGPT.

OpenAIAcción de usuario
ChatGPT-User

Visita tu web en directo cuando un usuario de ChatGPT pide información que requiere consultar tu página.

OpenAIBúsqueda
OAI-SearchBot

Indexa webs para que aparezcan como resultados y enlaces en la búsqueda de ChatGPT.

AnthropicEntrenamiento
ClaudeBot

Recopila contenido público para entrenar y mejorar los modelos Claude de Anthropic.

AnthropicAcción de usuario
Claude-User

Accede a tu web en directo cuando un usuario de Claude hace una pregunta que requiere consultarla.

AnthropicBúsqueda
Claude-SearchBot

Indexa contenido web para mejorar la calidad y relevancia de los resultados de búsqueda de Claude.

GoogleMixto
Googlebot

Rastrea la web para la búsqueda de Google, incluidos los resúmenes con IA (AI Overviews).

GoogleEntrenamiento
Google-Extended

Token de control en robots.txt que decide si tu contenido puede usarse para entrenar los modelos Gemini de Google.

GoogleMixto
GoogleOther

Rastreador genérico que los equipos de producto de Google usan para descargar contenido público con fines diversos, incluida investigación y desarrollo de IA.

PerplexityBúsqueda
PerplexityBot

Indexa webs para mostrarlas y enlazarlas en los resultados de búsqueda de Perplexity.

PerplexityAcción de usuario
Perplexity-User

Visita tu web en directo cuando un usuario hace una pregunta en Perplexity que requiere consultar tu página.

MicrosoftMixto
Bingbot

Rastrea la web para el buscador Bing y alimenta también las respuestas de Microsoft Copilot.

MetaEntrenamiento
meta-externalagent

Rastrea la web para entrenar los modelos de IA de Meta (Llama) y para indexar contenido en sus productos.

MetaAcción de usuario
meta-externalfetcher

Descarga enlaces concretos que piden los usuarios y asiste a las capacidades agénticas de la IA de Meta.

AppleBúsqueda
Applebot

Rastrea la web para las funciones de búsqueda de Apple: Siri, Spotlight y sugerencias de Safari.

AppleEntrenamiento
Applebot-Extended

Token de control que decide si Apple puede usar tu contenido para entrenar los modelos de Apple Intelligence.

AmazonMixto
Amazonbot

Rastrea la web para mejorar productos y servicios de Amazon, como las respuestas de Alexa, y puede usarse para entrenar sus modelos de IA.

ByteDanceEntrenamiento
Bytespider

Recopila contenido web de forma masiva para entrenar los modelos de IA de ByteDance, la empresa de TikTok y Doubao.

Common CrawlEntrenamiento
CCBot

Crea un archivo abierto de la web que sirve de base de entrenamiento para muchos modelos de IA.

CohereEntrenamiento
cohere-training-data-crawler

Recopila contenido web público para entrenar los modelos de lenguaje de Cohere, orientados a empresas.

Mistral AIAcción de usuario
MistralAI-User

Visita tu web cuando un usuario de Vibe, el asistente de Mistral, hace una pregunta que requiere consultarla.

DuckDuckGoBúsqueda
DuckAssistBot

Recoge contenido para DuckAssist, las respuestas generadas con IA del buscador DuckDuckGo.

You.comBúsqueda
YouBot

Descubre e indexa páginas web para que el buscador y los asistentes de IA de You.com den respuestas actualizadas.

DiffbotMixto
Diffbot

Extrae datos estructurados de páginas web para construir una base de conocimiento que usan empresas y sistemas de IA.

Allen Institute for AIEntrenamiento
AI2Bot

Recopila documentos web para crear datasets abiertos con los que entrenar y evaluar modelos de lenguaje de Ai2.

xAIMixto
GrokBot

Recupera contenido web para Grok, el asistente de IA de xAI integrado en X (antes Twitter).

HuaweiMixto
PetalBot

Rastrea la web para Petal Search, el buscador de Huawei, y los servicios de su ecosistema.

HiveMixto
ImagesiftBot

Recopila imágenes públicas y su contexto para los productos de inteligencia web e IA de Hive.

GoogleAcción de usuario
Google-NotebookLM

Descarga el contenido de una URL cuando un usuario de NotebookLM, la app de notas con IA de Google, la añade manualmente como fuente en su proyecto.

GoogleAcción de usuario
Google-Read-Aloud

Sirve a la función 'Leer en voz alta' de Google: cuando un usuario pide que se le lea una página web, este bot descarga el texto para reproducirlo como audio.

GoogleMixto
Google-CloudVertexBot

Indexa el contenido de tu web para alimentar los agentes de IA y el buscador empresarial construidos sobre Google Cloud Vertex AI.

GoogleAcción de usuario
Google-InspectionTool

Comprueba cómo ve Google tu página cuando tú mismo lo solicitas desde la herramienta de Inspección de URL de Search Console o el Test de Resultados Enriquecidos.

GoogleAcción de usuario
Google-Agent

Navega por la web en nombre de un usuario real para que el agente de IA de Google (Project Mariner) pueda ejecutar tareas concretas, como buscar información o interactuar con páginas web.

MicrosoftBúsqueda
msnbot

Rastreaba páginas web para construir el índice de Bing y de su predecesor MSN Search, ayudando a que los sitios apareciesen en los resultados del buscador de Microsoft.

AmazonBúsqueda
Amzn-SearchBot

Rastrea contenido web público para mejorar la relevancia de la búsqueda en productos de Amazon, incluida Alexa.

MetaMixto
facebookexternalhit

Genera la vista previa del enlace cuando alguien comparte tu web en Facebook, Instagram o Messenger.

MetaEntrenamiento
FacebookBot

Descarga contenido público de webs para construir los datos de entrenamiento de la tecnología de reconocimiento de voz de Meta.

MetaMixto
meta-externalads

Rastrea paginas externas para revisar anuncios de Meta y generar las previsualizaciones de enlace que aparecen en Facebook, Instagram y WhatsApp.

BaiduBúsqueda
Baiduspider

Rastrea páginas web públicas para indexarlas en Baidu, el mayor motor de búsqueda de China.

Moonshot AIEntrenamiento
KimiBot

Recopila contenido público para entrenar los modelos de IA de Moonshot AI, la empresa china detrás del asistente Kimi.

Moonshot AIAcción de usuario
Kimi-User

Accede a tu web bajo demanda cuando un usuario de Kimi pide información en tiempo real o resumir un artículo.

Moonshot AIBúsqueda
Kimi-SearchBot

Analiza páginas web para evaluar su relevancia y construir el índice de búsqueda de Kimi, el asistente de IA de Moonshot AI.

Mistral AIBúsqueda
MistralAI-Index

Recorre páginas web públicas para indexar contenido que alimenta el motor de búsqueda de Mistral dentro de Vibe.

OpenAIMixto
OAI-AdsBot

Comprueba que las páginas de destino de los anuncios enviados a ChatGPT cumplen las políticas de OpenAI y son relevantes para el anuncio.

Webz.ioEntrenamiento
webzio-extended

Valida qué contenido web puede usarse legalmente para entrenar modelos de IA y lo etiqueta para los clientes de Webz.io que construyen pipelines de datos.

Webz.ioMixto
omgilibot

Rastrea noticias, foros y contenido generado por usuarios para alimentar la API de datos de Webz.io, que se vende tanto a herramientas de monitorización de medios como a empresas que entrenan modelos de IA.

Velen.ioEntrenamiento
VelenPublicWebCrawler

Rastrea webs públicas para construir conjuntos de datos empresariales y entrenar los modelos de inteligencia artificial de Hunter.io.

Bright DataMixto
Brightbot

Recopila datos públicos de webs en nombre de clientes empresariales que necesitan vigilancia de precios, análisis de competencia o bases de datos comerciales.

SemrushMixto
SemrushBot-OCOB

Recopila contenido público de webs para alimentar el Content Toolkit de Semrush, una suite de herramientas de marketing de contenido con componentes de IA.

YandexBúsqueda
YandexAdditionalBot

Rastrea páginas ya indexadas por Yandex para extraer contenido y usarlo como fuente en las respuestas generativas de YandexGPT, el buscador con IA de Yandex.

TimpiBúsqueda
Timpibot

Rastrea webs públicas para construir el índice del motor de búsqueda descentralizado de Timpi, con la posibilidad de que ese índice se use también para entrenar modelos de IA.

AndiBúsqueda
Andibot

Rastrea webs públicas para alimentar los resultados de Andi, un motor de búsqueda que responde preguntas con resúmenes generados por IA en lugar de una lista de enlaces.

iAskBúsqueda
iaskspider

Rastrea páginas web públicas para construir el índice que utiliza iAsk, un buscador de respuestas impulsado por IA.

PhindBúsqueda
PhindBot

Rastrea páginas web bajo demanda para alimentar los resultados de Phind, un motor de búsqueda con IA orientado a programadores y perfiles técnicos.

Romain BeaumontEntrenamiento
img2dataset

Descarga imágenes de webs públicas a gran escala para construir conjuntos de datos con los que entrenar modelos de IA de visión e imagen.

HuaweiEntrenamiento
PanguBot

Descarga contenido de webs públicas para entrenar PanGu, el modelo de inteligencia artificial multimodal de Huawei.

Research Organization of Information and SystemsEntrenamiento
Cotoyogi

Recoge contenido web en japonés para construir bases de datos con las que entrenar modelos de inteligencia artificial.

AwarioMixto
AwarioBot

Recorre webs públicas en busca de menciones de marcas y palabras clave para los clientes del servicio de monitorización Awario.

Los bots ya leen tu web. ¿Sabes qué dice la IA de tu negocio?