# roicos.com # # Policy: máxima distribución. Buscadores y motores de IA (cita + entrenamiento) son # bienvenidos; solo se bloquea el scraper abusivo sin valor de cita. Ver /llms.txt para # el mapa curado del sitio para agentes IA, y /agents.md para cuándo-usar-qué más el # listado de endpoints máquina-legible. Toda página también está en Markdown: cabecera # `Accept: text/markdown`, o añadir `.md`. # # El robots.txt del WordPress bloqueaba /wp-admin/, /*/feed, /?* y /?s= — nada de eso existe # en un sitio estático, así que no se arrastra. # # El noindex de los deploys de preview NO va aquí ni en _headers: vive en # functions/_middleware.ts filtrando por host `*.pages.dev` (lección de Epinium, donde un # `/* X-Robots-Tag: noindex` en _headers desindexó producción). # --- Búsqueda tradicional --- User-agent: Googlebot Allow: / User-agent: Bingbot Allow: / # --- Motores de IA que citan en respuesta (tráfico GEO) --- User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / User-agent: Google-Extended Allow: / User-agent: Applebot-Extended Allow: / # --- Crawlers de entrenamiento (permitidos: upside de marca, downside nulo para contenido de marketing) --- User-agent: GPTBot Allow: / User-agent: ClaudeBot Allow: / User-agent: anthropic-ai Allow: / User-agent: Claude-Web Allow: / User-agent: CCBot Allow: / User-agent: Meta-ExternalAgent Allow: / # --- Scraper abusivo (bloqueo declarado) --- User-agent: Bytespider Disallow: / # --- Todo lo demás --- User-agent: * Allow: / # Las landings de tráfico de pago y las thank-you llevan `noindex, follow` por página y están # excluidas del sitemap (ver astro.config.mjs). No se listan aquí: robots.txt no es el sitio # para esconder URLs que sí queremos que Google pueda rastrear y obedecer su meta robots. Sitemap: https://roicos.com/sitemap-index.xml # --- Puntos de entrada para agentes (no es directiva de rastreo; aquí para que sean # triviales de encontrar) --- # /llms.txt # /agents.md # /404.md