En Sekikawa (Niigata), una serpiente gigante de bambú y paja de 82,8 m y unas 2 t ha recorrido el pueblo este 30 de agosto durante el Taishitamonja Matsuri.
Su longitud remite al 28 de agosto de 1967, en recuerdo de las inundaciones de Uetsu.
#Japón
⚡ TRUCO SEO: Hay una herramienta GRATIS que te dice si estás BLOQUEANDO, sin saberlo, al crawler del que se han entrenado casi todos los modelos de IA. Y te dice quién puso el bloqueo y en qué mes exacto.
Sin registro. Escribes tu dominio y ya.
¿Y esto qué coño es?
Common Crawl es una organización sin ánimo de lucro que cada mes rastrea más de 2.000 millones de páginas y regala el archivo. El rastreo de julio tiene 2.140 millones.
Ese archivo es la materia prima de C4, RefinedWeb, RedPajama, Dolma y FineWeb. Cuando Mozilla auditó los modelos publicados entre 2019 y 2023, el 64% se había entrenado con datos de Common Crawl de alguna forma. GPT-3 era aproximadamente un 60% Common Crawl filtrado por peso de entrenamiento.
Su crawler se llama CCBot. Y aquí está lo que lo hace distinto de todos los demás:
GPTBot rastrea tu página para OpenAI. Punto.
CCBot rastrea tu página para todo el que se vaya a entrenar con la web abierta. Es el único crawler cuyas visitas componen.
El dato incómodo:
Unos 492.000 sitios nombran a CCBot en su robots.txt. El 95% lo hace para bloquearlo.
La pregunta que se hizo Suganthan Mohanadasan, que es quien montó la herramienta: ¿cuántos de esos medio millón lo decidieron de verdad?
Porque desde el 1 de julio de 2025, Cloudflare bloquea los crawlers de IA por defecto en cada dominio nuevo que sirve. Su robots.txt gestionado llegó a 3,8 millones de dominios más que nunca escribieron uno. Squarespace tiene su propio default. Los plugins añaden listas.
En 2026, un bloqueo de CCBot es tan probable que sea un default de plataforma como una decisión.
Para que veas hasta dónde llega: la BBC tiene 3 registros en el rastreo de julio. Tres. De todo el sitio. Bloquea 13 de los 14 crawlers de IA. Para la cadena de datos de entrenamiento, uno de los mayores medios del mundo no existe.
En su caso fue una decisión consciente. En el tuyo puede que no.
¿Qué te enseña la herramienta?
➡️ Capturas por rastreo: cuántas páginas tuyas cogió cada uno de los últimos 12 rastreos mensuales
➡️ Historial de robots.txt: Common Crawl guarda el robots.txt que leyó antes de cada rastreo. La herramienta los compara mes a mes, así que le pone fecha de inicio al bloqueo
➡️ De quién parece el bloqueo: el robots.txt gestionado de Cloudflare tiene un comentario de licencia distintivo. El de Squarespace, su propia firma. Y si caen 8 o más tokens de IA de golpe, suele ser un plugin o una lista copiada
➡️ Sonda en vivo: pide tu home como CCBot, como navegador normal y como bot de control. Esto pilla el bloqueo que el robots.txt nunca enseña
Y ahí está la parte que casi nadie comprueba
Hay dos tipos de bloqueo que no ves mirando tu robots.txt a mano:
1️⃣ El default del CDN. Un dominio creado en Cloudflare después de julio de 2025 bloquea crawlers de IA salvo que alguien lo desactivara
2️⃣ Una regla de edge. Un WAF poniéndole un challenge a CCBot mientras tu robots.txt se lee limpio
El segundo es el único sitio donde no mira ningún crawler de SEO clásico.
Si sales abierto pero apenas capturado, el problema nunca fue el bloqueo. Era prioridad de rastreo:
➡️ Arregla el CDN primero. Si la sonda muestra challenge, ningún cambio en robots.txt te sirve
➡️ Mete el sitemap en el robots.txt. CCBot sigue el protocolo
➡️ Renderiza en servidor. CCBot no ejecuta JavaScript, así que el contenido que solo existe tras la hidratación deja una cáscara vacía en los datos de entrenamiento
Lo que NO te dice, y conviene decirlo
Estar en Common Crawl no te mete en un modelo. Cada set de entrenamiento filtra el archivo, y los laboratorios grandes dejaron de publicar sus mezclas hacia 2023.
Y una cobertura pobre tampoco prueba nada por sí sola, porque Common Crawl es una muestra de la web, no una copia.
Lo que te da es visibilidad. Si tus páginas clave no se están rastreando, al menos lo vas a saber.
📎 https://t.co/1EPNy7Xay2
El koto japonés sonará en Madrid este 17 de septiembre. 🎶
La EOI Jesús Maestro acogerá a las 18:30 un concierto gratuito de koto y voz con Namie y Momoka Tsukahara, Shigemi Shibata, Yui Kasahara y Javi Mejías.
https://t.co/V9N0hUQIPX
#Japón#CulturaJaponesa
Si ya tienes 'The Witcher 3', el remaster no te costará nada. 👀
Llega el 29 de septiembre como actualización gratuita en plataformas compatibles. Y además, 'Hearts of Stone' y 'Blood and Wine' ya están incluidos sin coste adicional.
#TheWitcher
6 repos de AI Agents que estan explotando en github
1. Graft —
https://t.co/HRrD5zZloC
Hace que claude code sea 4 veces mas barato y 3 veces mas rapido, es compatible con cualquier agente 60% menos tiempo por sesión
2. Agency agents —https://t.co/h5OQHPS2nD
Agencia de IA completa con 232 sub agentes especializados en 16 areas
3. Codebase memory mcp —https://t.co/heBgnRWzKe
Convierte todo tu codebase en un knowledge graph ultra rapido. Soporta 158 lenguajes, reduce tokens mas del 99% y responde en milisegundos
4. OpenMontage —https://t.co/9W4TVyJhPe
Convierte tu agente de coding en un estudio completo de produccion de videos. Planificacion, guion, assets, edicion y renderizado con solo prompts
5. Agent-Reach —https://t.co/QteQR6bcYq
Dale ojos a tu agente para navegar internet. Lee y busca en X, Reddit, YouTube, GitHub y mas. Todo gratis sin pagar APIs
6. Orca — https://t.co/o1OLK1seb3
Gestiona y ejecuta multiples agentes de coding en paralelo
Con estos dejas de usar un solo agente y pasas a manejar una flota completa
Guardalos todos 🔖
El Nishimonai Bon Odori (西馬音内盆踊り), designado como un importante bien cultural folclórico inmaterial de Japón, se celebra tradicionalmente del 16 al 18 de agosto en Ugo, prefectura de Akita. 🏮
#Japón
La estatua del gran tanuki de 5,3 m junto a la estación de Shigaraki luce ahora el atuendo de los comerciantes de Ōmi, originarios de la actual Shiga.
Confeccionado con tejidos tradicionales de la prefectura, podrá verse hasta el 27 de septiembre.
#Japón
Último verano para ver esta estampa en Ōgaki, Gifu.
El Doctor Yellow de JR West, el tren de inspección del Shinkansen, pasa junto al campo de unos 140.000 girasoles. 🌻🚄
Está previsto que deje de circular en enero de 2027.
#Japón
https://t.co/uidxju6yBd
El Museo de Arte dedicado a Kosugi Hōan, en Nikkō (Tochigi), acoge una exposición sobre fantasmas, yōkai y otras criaturas sobrenaturales, con el ukiyo-e como protagonista. La muestra reúne unas 90 piezas y puede visitarse hasta el 6 de septiembre. #Japón
https://t.co/cKk949rmpk
¡Cámaras en directo de distintos puntos de Japón desde un mapa!
Tomarigi, creado por @tomuisan, permite localizar y ver cámaras de YouTube que emiten en directo desde distintos lugares del país.
#Japón https://t.co/3ypiJtxlr7
¡'Dragon Quest' tendrá su propia versión de 'The Game of Life'!
Takara Tomy lo lanzará en Japón el 24 de octubre, con compañeros para formar tu grupo, cambios de clase, slimes, carruajes… y hasta una batalla final contra Zoma.
Ojalá termine llegando a Occidente. 🤞🏼
⚡ TRUCO SEO: Hay un panel gratuito donde puedes ver las sub-preguntas exactas que la IA se hace antes de responder sobre tu sector. Y qué página tuya está usando para responder a cada una.
No es beta cerrada ni herramienta de pago. Lleva ahí desde febrero y casi nadie lo abre.
Es Bing Webmaster Tools → AI Performance → Grounding queries.
Y viene muy a cuento esta semana. Si el desplome de Reddit en ChatGPT vino de un cambio de fan-out, la pregunta lógica es cómo ves tú los fan-outs de tu propio sitio. Pues así.
¿Y esto qué coño es?
Cuando le preguntas algo a una IA que necesita buscar en internet, no busca tu pregunta. Hace dos cosas:
1️⃣ Fan-out: rompe tu pregunta en preguntas más pequeñas y específicas
2️⃣ Grounding queries: convierte esos fragmentos en búsquedas reales que ejecuta contra el índice
Las grounding queries no son lo que escribe el usuario. Son las frases internas que el sistema de recuperación genera para encontrar contenido candidato antes de construir la respuesta.
Eso es mirar dentro de la caja negra.
En Google NO PUEDES. PEEEERO... En Bing sí, gratis y para tu propio dominio.
Y la parte que lo cambia todo: la búsqueda web de ChatGPT se apoya en el índice de Bing.
O sea que ese panel que llevas dos años ignorando porque "Bing es el 3% del tráfico" es hoy la ventana más directa que existe al proceso de recuperación de la IA sobre tu contenido.
¿Qué te da exactamente?
➡️ Grounding queries: las frases de recuperación reales, no las de tu Search Console
➡️ Citation share: cuánto te citan a ti frente al total de tu temática
➡️ Intents: qué intención tiene cada grounding query
➡️ Topics: sobre qué temas la IA considera que tu sitio es fuente
➡️ Pages: qué URL tuya concreta responde a cada fragmento
➡️ Compare: cómo evoluciona en el tiempo
Traducción a entregables:
➡️ Grounding queries sin página tuya que responda → briefs de contenido. Y no basados en volumen de búsqueda, sino en lo que la IA está buscando activamente
➡️ Grounding queries donde sí te citan → esas páginas son tus activos GEO. Protégelas, actualízalas, no las toques a la ligera
➡️ Topics donde no apareces pero deberías → tu mapa de expansión temática
➡️ Una URL respondiendo a muchos fragmentos distintos → candidata a dividirse en varias páginas más específicas
➡️ Muchas URLs respondiendo al mismo fragmento → canibalización, ahora también en IA
Lo mejor del truco: mientras medio sector intenta adivinar los fan-outs de ChatGPT corriendo el mismo prompt 30 veces, Bing te los está enseñando gratis desde el 9 de febrero.
Wil Reynolds, CEO de Seer Interactive, lo dijo así en su investigación sobre fan-outs: "Gracias a Dios por Bing Webmaster Tools, que te da los fan-outs, o grounding queries."
Tarda 5 minutos: verifica tu dominio en Bing Webmaster Tools y abre AI Performance.
Si llevas años sin entrar, prepárate para sorpresas.
📎 https://t.co/aC4SIA7byl
Si usas Claude Code, activa esto para ahorrar tokens.
→ Usa el comando /config
→ Busca "Output"
→ Elige el modo "Concise"
Mantiene las respuestas cortas en la sesión y sólo te da explicaciones cuando se las pides.
El Awa Odori de la ciudad de Tokushima también cuenta con actuaciones en interior. 🏮
Imágenes del "Yume no Butai Matsuribi" (夢の舞台 祭りび), el espectáculo escénico diurno celebrado en el Awagin Hall del 12 al 15 de agosto.
#Japón
Alrededor de 1,5 millones de girasoles están en plena floración en un campo de unas 8 hectáreas de Nasu Heartful Farm, en Nasu (Tochigi). 🌻
Podrá visitarse hasta el 21 de agosto.
#Japón https://t.co/npYYDRcgHL
Nuevo clip de 'Coyote vs. ACME', la película en la que el Coyote lleva a juicio a la marca ACME por los productos que le han fallado durante años. 🧨
Se estrena el 28 de agosto en EE. UU. y el 18 de septiembre en España.
#CoyoteVsAcme#LooneyTunes