FuneralHomeWebsites.cc
← Volver al blogRead in English →
AI & search19 ago 2026 · 8 min de lectura

Nueve robots leen el sitio web de su funeraria — bloquear el equivocado le cuesta la mención

OpenAI, Anthropic y Perplexity envían nueve robots distintos al sitio web de su funeraria, y Google añade un token de control que ni siquiera es un robot. Solo algunos tienen que ver con el entrenamiento de la IA — y el que un propietario bloquea por frustración suele ser el que elimina a su funeraria de las respuestas de IA por completo.

OpenAI publica cuatro robots web. Anthropic publica tres, Perplexity dos, y Google añade un token de control que no es un robot. Todos consultan un archivo de texto plano en el sitio web de su funeraria — robots.txt — antes de decidir qué tienen permitido hacer. La mayoría de los propietarios nunca ha abierto ese archivo — y quien construyó el sitio pudo haberlo editado sin preguntar.

El problema es este: los robots no hacen el mismo trabajo, y un bloqueo dirigido a una función suele caer sobre otra. La línea que un propietario añade para que su contenido no entrene modelos de IA es un ajuste. La línea que decide si ChatGPT puede nombrar a su funeraria cuando una familia pregunta a quién llamar es un ajuste distinto. Si los confunde, conserva el entrenamiento y pierde la mención.

Las tres funciones que puede tener un robot

Las cuatro empresas dividen sus robots de la misma manera:

  1. Rastreadores de entrenamiento: leen sus páginas para que los futuros modelos de IA aprendan de ellas.
  2. Indexadores de búsqueda: leen sus páginas para que la IA pueda encontrarlas y citarlas cuando alguien hace una pregunta.
  3. Recuperadores de usuario: buscan una sola página porque una persona real acaba de pedírsela a la IA.

Ninguna empresa usa un solo robot para las tres funciones. Esa separación lo es todo: puede mantener su contenido fuera de los datos de entrenamiento y seguir plenamente visible en las respuestas de IA — o bloquearlo todo y desaparecer en silencio. Las propias empresas lo dicen en su documentación. Esto es lo que publica cada una.

OpenAI: cuatro robots y una confusión cara

La documentación de robots de OpenAI enumera cuatro agentes y aclara que cada ajuste es independiente de los demás: un sitio puede permitir uno y rechazar otro.

GPTBot es el rastreador de entrenamiento. Según OpenAI, rechazarlo indica que el contenido del sitio no debe usarse para entrenar sus modelos fundacionales de IA. Bloquearlo es una decisión sobre el entrenamiento, y solo sobre el entrenamiento.

OAI-SearchBot es el indexador de búsqueda, y esta es la línea que importa para la visibilidad. La misma página lo dice sin rodeos: los sitios excluidos de OAI-SearchBot no se muestran en las respuestas de búsqueda de ChatGPT, aunque pueden aparecer como enlaces de navegación. Esa es la mención — perdida — en palabras de la propia OpenAI.

ChatGPT-User recupera páginas cuando una persona lo pide. OpenAI señala que no rastrea la web de forma automática y que, al tratarse de acciones iniciadas por un usuario, las reglas de robots.txt pueden no aplicarse.

OAI-AdsBot revisa páginas enviadas como anuncios en ChatGPT, y OpenAI afirma que sus datos no se usan para entrenar modelos.

Así que una funeraria que bloqueó GPTBot se mantuvo fuera del entrenamiento y no perdió nada en las respuestas de ChatGPT. Una funeraria que bloqueó todo lo de OpenAI de una vez se quitó a sí misma de las respuestas de búsqueda de ChatGPT sin saberlo.

Anthropic: la misma división, otros nombres

Anthropic documenta tres robots, divididos exactamente igual. ClaudeBot es entrenamiento: restringirlo señala que los materiales futuros del sitio deben excluirse de sus datos de entrenamiento. Claude-SearchBot es el índice: desactivarlo impide que su sistema indexe el contenido, lo que puede reducir la visibilidad y la precisión del sitio en los resultados. Claude-User es la recuperación a petición de una persona.

Una nota práctica de la misma página: Anthropic desaconseja bloquear por dirección IP, porque eso le impide leer el archivo robots.txt. Si el robot no puede leer las reglas, no puede seguirlas.

Perplexity: ninguno de sus robots entrena

La documentación de Perplexity es la más simple de las cuatro: PerplexityBot no se usa para recopilar contenido destinado a entrenar modelos, y Perplexity recomienda permitirlo para que su sitio aparezca en sus resultados de búsqueda. Perplexity-User recupera páginas a petición y, como lo pidió un usuario, generalmente ignora las reglas de robots.txt. Aquí no existe ningún rastreador de entrenamiento que bloquear — un bloqueo solo puede costar visibilidad.

Google es el caso extraño

Google-Extended aparece en los archivos robots.txt como si fuera un robot, pero la documentación de rastreadores de Google explica que no tiene un agente de usuario propio: el rastreo lo hacen los agentes existentes de Google, y el token funciona como un control.

Lo que controla es más amplio de lo que suele contarse: si su contenido entrena a los futuros modelos Gemini y si se usa para el “grounding” — la palabra de Google para incorporar su contenido en una respuesta de Gemini en el momento en que alguien pregunta. Y lo que no toca está dicho con la misma claridad: Google-Extended no afecta la inclusión del sitio en la Búsqueda de Google ni funciona como señal de posicionamiento.

Léalo como propietario de una funeraria: bloquear Google-Extended para quedar fuera del entrenamiento también lo excluye de que Gemini lo cite cuando una familia de su condado le hace una pregunta. Su posición en la Búsqueda de Google no se mueve en ningún caso. Ese es el intercambio, y es real — los resúmenes de IA ya se posan sobre las búsquedas funerarias que sus familias escriben.

Los nueve robots, en una tabla

AgenteEmpresaSu funciónBloquearlo significa
GPTBotOpenAIentrenamientosus páginas no entrenan futuros modelos de OpenAI
OAI-SearchBotOpenAIíndice de búsquedano aparece en las respuestas de búsqueda de ChatGPT
ChatGPT-UserOpenAIrecuperación de usuariopoco — puede no respetar robots.txt
OAI-AdsBotOpenAIrevisión de anunciossolo anuncios; no entrena en ningún caso
ClaudeBotAnthropicentrenamientolos futuros modelos Claude excluyen su sitio
Claude-SearchBotAnthropicíndice de búsquedamenos visibilidad en los resultados de Claude
Claude-UserAnthropicrecuperación de usuariola petición de un usuario puede no llegar a su página
PerplexityBotPerplexityíndice de búsquedadesaparece de los resultados de Perplexity
Perplexity-UserPerplexityrecuperación de usuariopoco — generalmente ignora robots.txt
Google-ExtendedGoogleun token de control, no un robotsin entrenamiento de Gemini — y sin que Gemini lo cite al responder. La Búsqueda de Google: intacta

Qué hacer en la práctica, esta semana

Abra el archivo. Escriba su propio dominio seguido de /robots.txt en el navegador — sufuneraria.com/robots.txt. Es público; no hay que iniciar sesión. Busque en la página GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y Google-Extended.

Mantenga encendidos los robots de búsqueda. OAI-SearchBot, Claude-SearchBot y PerplexityBot son la vía por la que las respuestas de IA encuentran y citan a su funeraria. Cuando medimos 924 sitios web de funerarias, pudimos leer 827 de ellos, y el 35.6% obtuvo D o F en los fundamentos sobre los que se construyen las respuestas de IA — y un robots.txt que bloquea los indexadores de búsqueda limita lo que cualquier otra mejora puede lograr. Si hay una línea “Disallow” bajo alguno de esos tres nombres y nadie recuerda haberla elegido, eso es lo primero que hay que cambiar.

Decida el entrenamiento a propósito. Que OpenAI o Anthropic entrenen con sus páginas de obituarios es una cuestión de valores, y hay propietarios razonables en ambos lados. Decídalo deliberadamente, sabiendo que es independiente: bloquear GPTBot y ClaudeBot no le cuesta nada en las respuestas de IA de hoy.

Pregunte a quien administra su sitio web qué eligió por usted. Cualquier empresa de sitios web puede leer este mismo archivo y cambiar las mismas líneas — esto no es propiedad de nadie. Si hay un conjunto de líneas que lo bloquea todo y nadie recuerda haberlo elegido, lo más probable es que llegara con la plataforma, no con una decisión. La pregunta para su proveedor cabe en una frase: “¿Qué dice nuestro robots.txt sobre los rastreadores de IA, y quién lo decidió?”

Dele un día a los cambios. OpenAI señala que una actualización de robots.txt puede tardar unas 24 horas en registrarse. Los recuperadores de usuario seguirán ignorando el archivo de todos modos, y eso está bien — solo actúan cuando una persona pide su página, que es exactamente la atención que usted quiere.

Cuando una familia le pregunta a la IA a qué funeraria llamar, la respuesta se arma con páginas que un robot tuvo permiso de leer. Diez líneas en un archivo de texto que usted nunca ha abierto están decidiendo, ahora mismo, si su funeraria está en esa respuesta. La auditoría revisa exactamente esto — pero no nos necesita para hacerlo. Abra el archivo.

El equipo de FuneralHomeWebsites

Haga la cuenta con sus propios números.

La calculadora convierte un mes de servicios en lo que un sitio web sin comisiones deja en su funeraria — la aritmética toma treinta segundos.

Vea cuánto valen sus floresMás del blog →