Bots y crawlers de IA
Estos son los robots que leen tu web para alimentar a ChatGPT, Gemini, Perplexity y compañía. Si los bloqueas, tu negocio desaparece de sus respuestas.
¿Tu web deja entrar a estos bots?
Escribe tu dominio y te decimos qué rastreadores de IA permite o bloquea tu robots.txt. Gratis y sin registro.
58 rastreadores
GPTBotRecopila contenido público para entrenar los modelos de IA de OpenAI, como los que usa ChatGPT.
ChatGPT-UserVisita tu web en directo cuando un usuario de ChatGPT pide información que requiere consultar tu página.
OAI-SearchBotIndexa webs para que aparezcan como resultados y enlaces en la búsqueda de ChatGPT.
ClaudeBotRecopila contenido público para entrenar y mejorar los modelos Claude de Anthropic.
Claude-UserAccede a tu web en directo cuando un usuario de Claude hace una pregunta que requiere consultarla.
Claude-SearchBotIndexa contenido web para mejorar la calidad y relevancia de los resultados de búsqueda de Claude.
GooglebotRastrea la web para la búsqueda de Google, incluidos los resúmenes con IA (AI Overviews).
Google-ExtendedToken de control en robots.txt que decide si tu contenido puede usarse para entrenar los modelos Gemini de Google.
GoogleOtherRastreador genérico que los equipos de producto de Google usan para descargar contenido público con fines diversos, incluida investigación y desarrollo de IA.
PerplexityBotIndexa webs para mostrarlas y enlazarlas en los resultados de búsqueda de Perplexity.
Perplexity-UserVisita tu web en directo cuando un usuario hace una pregunta en Perplexity que requiere consultar tu página.
BingbotRastrea la web para el buscador Bing y alimenta también las respuestas de Microsoft Copilot.
meta-externalagentRastrea la web para entrenar los modelos de IA de Meta (Llama) y para indexar contenido en sus productos.
meta-externalfetcherDescarga enlaces concretos que piden los usuarios y asiste a las capacidades agénticas de la IA de Meta.
ApplebotRastrea la web para las funciones de búsqueda de Apple: Siri, Spotlight y sugerencias de Safari.
Applebot-ExtendedToken de control que decide si Apple puede usar tu contenido para entrenar los modelos de Apple Intelligence.
AmazonbotRastrea la web para mejorar productos y servicios de Amazon, como las respuestas de Alexa, y puede usarse para entrenar sus modelos de IA.
BytespiderRecopila contenido web de forma masiva para entrenar los modelos de IA de ByteDance, la empresa de TikTok y Doubao.
CCBotCrea un archivo abierto de la web que sirve de base de entrenamiento para muchos modelos de IA.
cohere-training-data-crawlerRecopila contenido web público para entrenar los modelos de lenguaje de Cohere, orientados a empresas.
MistralAI-UserVisita tu web cuando un usuario de Vibe, el asistente de Mistral, hace una pregunta que requiere consultarla.
DuckAssistBotRecoge contenido para DuckAssist, las respuestas generadas con IA del buscador DuckDuckGo.
YouBotDescubre e indexa páginas web para que el buscador y los asistentes de IA de You.com den respuestas actualizadas.
DiffbotExtrae datos estructurados de páginas web para construir una base de conocimiento que usan empresas y sistemas de IA.
AI2BotRecopila documentos web para crear datasets abiertos con los que entrenar y evaluar modelos de lenguaje de Ai2.
GrokBotRecupera contenido web para Grok, el asistente de IA de xAI integrado en X (antes Twitter).
PetalBotRastrea la web para Petal Search, el buscador de Huawei, y los servicios de su ecosistema.
ImagesiftBotRecopila imágenes públicas y su contexto para los productos de inteligencia web e IA de Hive.
Google-NotebookLMDescarga el contenido de una URL cuando un usuario de NotebookLM, la app de notas con IA de Google, la añade manualmente como fuente en su proyecto.
Google-Read-AloudSirve a la función 'Leer en voz alta' de Google: cuando un usuario pide que se le lea una página web, este bot descarga el texto para reproducirlo como audio.
Google-CloudVertexBotIndexa el contenido de tu web para alimentar los agentes de IA y el buscador empresarial construidos sobre Google Cloud Vertex AI.
Google-InspectionToolComprueba cómo ve Google tu página cuando tú mismo lo solicitas desde la herramienta de Inspección de URL de Search Console o el Test de Resultados Enriquecidos.
Google-AgentNavega por la web en nombre de un usuario real para que el agente de IA de Google (Project Mariner) pueda ejecutar tareas concretas, como buscar información o interactuar con páginas web.
msnbotRastreaba páginas web para construir el índice de Bing y de su predecesor MSN Search, ayudando a que los sitios apareciesen en los resultados del buscador de Microsoft.
Amzn-SearchBotRastrea contenido web público para mejorar la relevancia de la búsqueda en productos de Amazon, incluida Alexa.
facebookexternalhitGenera la vista previa del enlace cuando alguien comparte tu web en Facebook, Instagram o Messenger.
FacebookBotDescarga contenido público de webs para construir los datos de entrenamiento de la tecnología de reconocimiento de voz de Meta.
meta-externaladsRastrea paginas externas para revisar anuncios de Meta y generar las previsualizaciones de enlace que aparecen en Facebook, Instagram y WhatsApp.
BaiduspiderRastrea páginas web públicas para indexarlas en Baidu, el mayor motor de búsqueda de China.
KimiBotRecopila contenido público para entrenar los modelos de IA de Moonshot AI, la empresa china detrás del asistente Kimi.
Kimi-UserAccede a tu web bajo demanda cuando un usuario de Kimi pide información en tiempo real o resumir un artículo.
Kimi-SearchBotAnaliza páginas web para evaluar su relevancia y construir el índice de búsqueda de Kimi, el asistente de IA de Moonshot AI.
MistralAI-IndexRecorre páginas web públicas para indexar contenido que alimenta el motor de búsqueda de Mistral dentro de Vibe.
OAI-AdsBotComprueba que las páginas de destino de los anuncios enviados a ChatGPT cumplen las políticas de OpenAI y son relevantes para el anuncio.
webzio-extendedValida qué contenido web puede usarse legalmente para entrenar modelos de IA y lo etiqueta para los clientes de Webz.io que construyen pipelines de datos.
omgilibotRastrea noticias, foros y contenido generado por usuarios para alimentar la API de datos de Webz.io, que se vende tanto a herramientas de monitorización de medios como a empresas que entrenan modelos de IA.
VelenPublicWebCrawlerRastrea webs públicas para construir conjuntos de datos empresariales y entrenar los modelos de inteligencia artificial de Hunter.io.
BrightbotRecopila datos públicos de webs en nombre de clientes empresariales que necesitan vigilancia de precios, análisis de competencia o bases de datos comerciales.
SemrushBot-OCOBRecopila contenido público de webs para alimentar el Content Toolkit de Semrush, una suite de herramientas de marketing de contenido con componentes de IA.
YandexAdditionalBotRastrea páginas ya indexadas por Yandex para extraer contenido y usarlo como fuente en las respuestas generativas de YandexGPT, el buscador con IA de Yandex.
TimpibotRastrea webs públicas para construir el índice del motor de búsqueda descentralizado de Timpi, con la posibilidad de que ese índice se use también para entrenar modelos de IA.
AndibotRastrea webs públicas para alimentar los resultados de Andi, un motor de búsqueda que responde preguntas con resúmenes generados por IA en lugar de una lista de enlaces.
iaskspiderRastrea páginas web públicas para construir el índice que utiliza iAsk, un buscador de respuestas impulsado por IA.
PhindBotRastrea páginas web bajo demanda para alimentar los resultados de Phind, un motor de búsqueda con IA orientado a programadores y perfiles técnicos.
img2datasetDescarga imágenes de webs públicas a gran escala para construir conjuntos de datos con los que entrenar modelos de IA de visión e imagen.
PanguBotDescarga contenido de webs públicas para entrenar PanGu, el modelo de inteligencia artificial multimodal de Huawei.
CotoyogiRecoge contenido web en japonés para construir bases de datos con las que entrenar modelos de inteligencia artificial.
AwarioBotRecorre webs públicas en busca de menciones de marcas y palabras clave para los clientes del servicio de monitorización Awario.