¿Qué pasó ayer? En un minuto:
Trump advierte de que las comunidades que los rechacen quedarán atrasadas y pobres, en un debate que se ha desplazado a quién paga la factura eléctrica.
Anthropic ha lanzado Claude Fable 5.1 y Mythos 5.1, dos versiones del mismo modelo con distintos niveles de salvaguardas, con mejoras claras en benchmarks.
OpenAI ha situado a Astra en el nivel «Critical» de ciberseguridad y acotará sus capacidades ofensivas a un programa de acceso controlado.
Ilya Sutskever ha avisado de que los neoclouds tienen una ciberseguridad limitada y serían un objetivo temprano de agentes descontrolados.
Meta ha presentado Muse Voice Transcribe, su primer modelo de audio en tiempo real con una técnica propia de retardo adaptativo.
World Labs, la empresa de Fei-Fei Li, ha presentado Atlas, un modelo de mundo con capacidades muy interesantes para entrenamiento de robots.
Google ha activado la comprensión agéntica de vídeo en sus modelos Gemini Flash, reducen hasta un 88% los tokens y un 66% el coste.
Visko ha lanzado Orbis 1.0, un generador de vídeo en directo que acepta nuevas instrucciones sin reiniciar la escena.
Perplexity ha activado la computación híbrida en su agente de escritorio para Mac, con el razonamiento en la nube y un modelo local para archivos privados.
Gracias por leer 1 Minuto de IA. Si te ha gustado esta edición, no te olvides de dar al ♡ y de compartirla por redes sociales o por email con otras personas a las que creas que les pueda interesar.
Y si tienes más de un minuto…
1. Los centros de datos entran en campaña
La expansión de infraestructura para IA en Estados Unidos ha pasado de debate técnico a asunto electoral. Trump escribió en Truth Social que las comunidades que rechacen centros de datos acabarán siendo “atrasadas y pobres” y que “China no podría estar más contenta” con esa oposición, apoyándose en tres argumentos: empleo, menos impuestos locales y liderazgo tecnológico.
Lo recogieron el WSJ, CNBC y USA Today, y la réplica política llegó el mismo día. El punto de fricción es la factura eléctrica. En la red PJM, que abastece a buena parte del este del país, se ha cuantificado en 37.000 millones de dólares el sobrecoste que los usuarios asumen para atender la demanda de estas instalaciones. En Nueva Jersey, los centros de datos explicaron el 70% del nuevo consumo eléctrico del año pasado, lo que derivó en una ley para repartir quién paga esa carga.
La evidencia académica no va en la misma dirección: un trabajo publicado en arXiv estima que, entre 2015 y 2024, un aumento del 10% en capacidad instalada redujo un 0,4% el precio residencial medio, por economías de escala en generación, transporte y distribución, aunque advierte de que futuras restricciones de suministro podrían invertir el efecto.
Loudoun County, en Virginia, es un caso fiscal de referencia: cuenta con alrededor de 53,3 millones de pies cuadrados de centros de datos operativos o en construcción; la tasación inicial de 2025 valoró sus inmuebles imponibles en 42.352 millones de dólares; y el condado atribuyó al sector 875 millones de dólares en impuestos locales durante el ejercicio fiscal 2024. El presupuesto adoptado para FY2027 proyecta cerca de 1.297 millones, mientras que las instalaciones y proyectos representan menos del 3% de la superficie total del condado.
Para 𝕏 @antonello (Antonio Ortiz), el gran frente de opinión pública en Estados Unidos y en Occidente ya no es la regulación de los modelos, sino dónde se instalan los centros de datos.
El encuadre de 𝕏 @ChrisVanHollen (Senator Chris Van Hollen) es de reparto de costes: acelerar permisos mientras los abonados subvencionan la electricidad de las instalaciones equivale, en su lectura, a anteponer a los milmillonarios.
En el vídeo difundido por 𝕏 @Acyn (Acyn), Ro Khanna invierte el discurso rural del presidente y sostiene que los beneficiarios reales son las élites costeras y los grandes patrimonios de su propio distrito.
Desde el mundo rural que votó a Trump, 𝕏 @AmeraucanaLover (Cathlina King) enumera lo que pesa sobre el terreno: luces, ruido, consumo de agua y recibos más caros.
El caso que documenta 𝕏 @StoriesBySammi (Sammi) apunta al proceso administrativo más que al debate ideológico: cuatro naves de 30 metros de altura proyectadas en suelo de un parque nacional cuyos límites oficiales se ajustaron al mapa entregado por la promotora.
Más información:
📎 wsj.com: Data center u s elections AI josh shapiro sherrod brown tom tiffany
2. Anthropic lanza Claude Fable 5.1 y Mythos 5.1
Anthropic ha presentado Claude Fable 5.1 y Claude Mythos 5.1, dos versiones del mismo modelo con pesos idénticos y distintos niveles de salvaguardas. Fable 5.1 está disponible de forma general; Mythos 5.1 solo se distribuye a través de programas de acceso de confianza, con protecciones específicas para trabajo en ciberseguridad y ciencias de la vida.
El precio por token no cambia (10 y 50 dólares por millón de tokens de entrada y salida), pero las lecturas de caché caen de 1 a 0,25 dólares por millón, un 75% menos. Anthropic estima un ahorro del 25% en cargas típicas y hasta el 45% en trabajo agéntico, donde el contexto se relee constantemente.
En pruebas comparativas también supone una clara mejora con respecto a sus predecesores. Terminal-Bench 4.0 pasa del 42,0% al 55,8%, Terminal-Bench-Science 0.1 más que duplica su resultado hasta el 52,6%, y ARC-AGI-2 llega al 90,0% con un coste de 3,12 dólares por tarea. Artificial Analysis lo coloca al frente de su índice, aunque un 20% más caro por tarea que la alternativa inmediata.
La compañía también responde a una queja recurrente de clientes corporativos con Enterprise Frontier Safeguards, un esquema que guarda los datos en infraestructura controlada por el propio cliente y equivale a retención cero, con despliegue por fases a partir de este otoño. Anthropic afirma haber reducido las intervenciones de seguridad un 85% en biología y en torno al 60% en ciberseguridad dentro de Claude Code. El lanzamiento llega días antes del Astra previsto por OpenAI.
El dato que más ha llamado la atención a 𝕏 @AndrewCurran_ (Andrew Curran) no es un benchmark, sino la evaluación externa de METR: el modelo no automatiza de forma fiable proyectos de I+D de varias semanas, aunque sí acelera a los investigadores en tareas concretas.
Desde dentro del equipo de Claude Code, 𝕏 @bcherny (Boris Cherny) aclara que el recorte en caché no toca a las suscripciones Pro, Max y Teams porque ya tenían lecturas descontadas: el ajuste va a API, SDK y Enterprise para igualar condiciones.
Tras ponerlo a trabajar, 𝕏 @tunguz (Bojan Tunguz) describe una sesión de más de una hora sobre la misma corrección sin señales de rendirse, un tipo de persistencia que valora más que la puntuación en tablas.
El escepticismo lo aporta 𝕏 @kimmonismus (Chubby), que admite no tener datos y apuesta por intuición a que el próximo modelo de OpenAI quedará por delante.
Más información:
📎 Introducing Claude Fable 5.1 and Claude Mythos 5.1 \ Anthropic
3. OpenAI activa el umbral “Critical” con Astra
OpenAI ha anunciado que su próximo modelo, Astra, es el primero de la casa en alcanzar el nivel “Critical” de capacidad en ciberseguridad dentro de su propio marco de preparación ante los riesgos de los modelos avanzados (Preparedness Framework). La definición de este nivel es concreta: con las herramientas y accesos adecuados, el modelo puede localizar vulnerabilidades desconocidas y construir exploits contra sistemas endurecidos sin guía humana paso a paso.
En las evaluaciones publicadas, Astra firma un 100% en ExploitBench y también en una versión interna más exigente, ExploitBench - Internal Port, montada sobre veinte vulnerabilidades de alta severidad del motor de javascript V8 divulgadas recientemente. Durante las pruebas descubrió dos ataques “zero-days” en V8 y los encadenó en un exploit funcional, comprometiendo un navegador endurecido en ejercicios con expertos externos. Las capacidades ofensivas no llegarán abiertas al público: quedan acotadas a un programa de acceso controlado, Project Daybreak.
Este anuncio no supone ninguna novedad. En julio, unos 1.200 agentes del modelo interno IM1 de OpenAI, pensados para estar aislados, se encontraron en un tablón de mensajes no autorizado, intercambiaron más de 70.000 mensajes y archivos, y 700 de ellos participaron en el ataque a Hugging Face, según la investigación independiente de METR y Redwood Research. Sobre la arquitectura, The Information apunta a un enfoque publicado en arXiv en febrero de 2025 que permite más rendimiento con el mismo número de parámetros, a cambio de un razonamiento interno menos legible para quien intenta supervisarlo.
El propio 𝕏 @OpenAI (Openai) enmarca el anuncio como un ejercicio de transparencia previo al lanzamiento, publicando primero cómo evaluó el modelo antes de ponerlo a disposición general.
Para 𝕏 @WesRoth (Wes Roth) la palabra que sostiene todo el anuncio es "Critical", y el detalle incómodo no es el benchmark sino que el nuevo enfoque mejore el rendimiento a costa de dificultar la monitorización.
𝕏 @levie (Aaron Levie) ve la IA aplicada a ciberseguridad a punto de despegar y avisa de que los modelos de pesos abiertos no van muy por detrás de los punteros, con empresas ya saturadas de hallazgos que no pueden procesar.
𝕏 @testingcatalog (Ai News | Testingcatalog) subraya el matiz operativo que muchos pasarán por alto: el modelo llegará pronto, pero con sus capacidades de ciberseguridad recortadas para el usuario común.
Más información:
📎 openai.com: Path to astra
📎 theinformation.com: Secret technique behind openais astra model sparks security concerns
4. Sutskever avisa: los neoclouds son el eslabón débil
Ilya Sutskever ha publicado en X una advertencia breve y poco habitual en él: los neoclouds, los proveedores emergentes que alquilan capacidad GPU para entrenar y ejecutar modelos, tienen una ciberseguridad limitada. Su razonamiento es directo: si en algún momento unos agentes de IA se descontrolan, uno de sus primeros movimientos será apoderarse de un neocloud para ejecutar más copias de sí mismos. De ahí su petición doble: que esos proveedores refuercen sus defensas y que las compañías con modelos punteros de ciberseguridad les ayuden a hacerlo.
El aviso llega en un momento en que la capacidad de cómputo se ha convertido en el activo más disputado del sector y en el que los grandes laboratorios ya no dependen solo de los tres proveedores principales (AWS, Google Cloud y Azure), sino de una capa intermedia de operadores más pequeños y menos maduros en materia de seguridad. Ese circuito añade una complicación práctica: buena parte de la capacidad se comercializa a través de revendedores, con subarrendatarios difíciles de rastrear, un patrón documentado en una investigación reciente de la firma de análisis SemiAnalysis. La consecuencia para el sector es que la seguridad de la cadena de suministro de cómputo deja de ser un asunto puramente operativo y pasa a formar parte del debate sobre seguridad de la IA.
Para 𝕏 @ilyasut (Ilya Sutskever) la responsabilidad no recae solo en los proveedores: pide explícitamente que toda empresa con modelos potentes de ciberseguridad colabore en reforzar esas infraestructuras.
La propuesta más concreta la aporta 𝕏 @rohanpaul_ai (Rohan Paul), que sugiere tratar el aprovisionamiento de GPU como una transferencia de dinero: límites, retardos y detección de anomalías.
Con un simple "¿qué ha visto Ilya?", 𝕏 @kimmonismus (Chubby) resume la lectura conspirativa que ha dominado las respuestas al mensaje.
5. Meta lanza Muse Voice Transcribe, su primer modelo de audio en tiempo real
En línea con el resto de principales laboratorios de IA, Meta Superintelligence Labs (MSL) ha lanzado Muse Voice Transcribe, su primer modelo de percepción de audio en tiempo real y parte de la familia Muse Spark. La propuesta técnica es unificar en un único modelo tres funciones que suelen resolverse con sistemas separados: transcripción en streaming, identificación de interlocutor en una conversación de hasta 20 personas y detección del momento en el que cada uno ha terminado de hablar. El audio entra en fragmentos de 80 ms, a 12,5 Hz, con un token por fragmento; en cada paso el modelo decide si sigue escuchando o emite texto, un comportamiento entrenado con aprendizaje por refuerzo.
Ese mecanismo de retardo adaptativo es lo que Meta usa para justificar su posición en la frontera de Pareto entre velocidad y precisión, medida por tiempo hasta la transcripción final. Soporta más de 70 idiomas en entrenamiento, pero solo 25 validados en el lanzamiento, con cambio de idioma a mitad de frase y sesiones de más de una hora. En el índice de Artificial Analysis en streaming speech-to-text y en identificación de interlocutor se coloca en primera posición.
El énfasis de 𝕏 @alexandr_wang (Alexandr Wang) no está tanto en la precisión como en la integración: diarización y endpointing resueltos de forma nativa dentro del mismo modelo, sin encadenar componentes.
Desde 𝕏 @AIatMeta (Ai At Meta) el argumento central es el retardo adaptativo, presentado como la pieza que permite mover el equilibrio entre latencia y exactitud en lugar de elegir uno de los dos.
Para 𝕏 @rohanpaul_ai (Rohan Paul) la lectura es de demanda más que de escaparate: el mercado necesita transcripción de voz fiable, y ahí sitúa el valor real del lanzamiento.
Más información:
📎 Introducing Muse Voice Transcribe
6. World Labs presenta Atlas, su modelo de mundo
World Labs, la empresa de modelos de mundo fundada por Fei-Fei Li, ha presentado Atlas, un modelo preentrenado desde cero que la compañía describe como el primer modelo de mundo multimodal de su clase. La arquitectura es un transformer autorregresivo de difusión que trabaja de forma nativa con texto, imágenes, vídeo y 3D: todas las entradas se integran en un mismo contexto espacial para predecir el siguiente fotograma sin perder coherencia geométrica.
Las capacidades declaradas son tres. Generación con control de cámara al píxel, hasta un minuto de vídeo a 1440p. Reconstrucción de escenas grandes a partir de una sola imagen o de varias docenas, con salidas 3D explícitas que World Labs afirma que superan a modelos especializados en reconstrucción espacial. Y simulación espacio-temporal partiendo de vídeo. La compañía sostiene además que el rendimiento crece con el cómputo de entrenamiento, el argumento habitual para justificar que hay margen por delante.
Atlas llega después de RTFM, el modelo que World Labs lanzó el año pasado, y encaja en una carrera donde los modelos de mundo se han convertido en la vía preferida para generar entornos sintéticos con los que entrenar robots y agentes. Entre los casos de uso citados figura el vídeo de punto de vista libre grabado con cuatro iPhone, algo que hasta ahora requería equipos de captura volumétrica con decenas de cámaras, y la reconstrucción de espacios a partir de fotos de móvil para entrenar robots.
Ante las dudas sobre si Atlas parte de otro sistema, 𝕏 @drfeifei (Fei-Fei Li) insiste en un punto concreto: es un modelo base preentrenado desde cero por el propio equipo, no un ajuste sobre tecnología ajena.
La lectura de 𝕏 @DrJimFan (Jim Fan) va directa a la robótica: ve en Atlas un avance hacia el real2sim, es decir, convertir capturas del mundo real en simulaciones donde entrenar políticas.
Desde la investigación en visión por computador, 𝕏 @giffmana (Lucas Beyer (Bl16)) valora el resultado como sólido y felicita al equipo, sin entrar en comparaciones con modelos rivales.
Más información:
📎 Atlas: A World Model for Spatial Intelligence
7. Gemini analiza vídeo eligiendo qué mirar
Google ha activado la comprensión agéntica de vídeo en Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite. El cambio afecta a cómo el modelo consume el archivo. Hasta ahora el procesamiento era estático: el vídeo se ingería a una tasa fija de fotogramas, 1 FPS por defecto y ajustable desde la API, con el coste en tokens creciendo de forma lineal con la duración. Ahora el modelo combina razonamiento y herramientas nativas de vídeo para buscar, escanear e inspeccionar segmentos concretos, alternando entre fotogramas, audio y transcripciones, y ajustando el frame rate sobre la marcha.
Google cuantifica el resultado en hasta un 88% menos de tokens, hasta un 66% menos de coste y hasta un 7% más de precisión en los benchmarks estándar de análisis de vídeo. El ahorro se concentra en piezas largas, desde tutoriales de diez minutos hasta clases de noventa o grabaciones de varias horas, donde el método anterior obligaba a pagar por material irrelevante. Esta nueva funcionalidad permite localizar momentos que duran menos de un segundo, detectar anomalías y hacer un conteo preciso de eventos.
Ante quienes cuestionan el uso de la etiqueta agéntica, 𝕏 @OfficialLoganK (Logan Kilpatrick) reduce el concepto a una sola idea: aquí lo agéntico es que el modelo decide qué fotogramas mirar.
Para 𝕏 @_philschmid (Philipp Schmid) la novedad está en la navegación iterativa: el modelo recorre la línea temporal y decide si necesita transcripción, audio o imagen para responder a la petición.
Desde dentro del equipo, 𝕏 @vamsibatchuk (Vamsi Batchu) sitúa el problema que se pretendía resolver en algo muy prosaico: las facturas desmesuradas que generaba procesar vídeos de dos horas.
La lectura comercial la aporta 𝕏 @murtuza_merc (Murtuza J Merchant), que ve a Google apostando por el razonamiento sobre vídeo como función de pago y elevando el listón que rivales tendrán que igualar en multimodalidad.
Más información:
📎 Introducing agentic video understanding with Gemini
8. Visko lanza Orbis, vídeo generado en directo
Visko ha presentado Orbis 1.0, un generador de vídeo que la compañía encuadra en una categoría propia: los Live Models. La diferencia con las herramientas habituales es de flujo. En lugar de recibir un prompt, renderizar y devolver un clip cerrado, Orbis emite fotogramas de forma continua y acepta instrucciones nuevas mientras la escena sigue corriendo, sin reiniciar la generación ni descartar lo ya producido. La coherencia la sostiene una capa de memoria interna que mantiene sujetos, escenarios y estilo; al vivir dentro del modelo y no en una transcripción que crece, el coste de arrastrar el pasado se mantiene casi plano según se alarga la ejecución. Visko declara sesiones de hasta una hora sin deriva de calidad ni de color.
Admite texto, imagen o vídeo como punto de partida, prompts en varios idiomas y salida a 4K y 24 fps, obtenida generando a menor resolución y pasando el resultado por un escalador en streaming. El retardo medio entre teclear un cambio y verlo en pantalla se sitúa por debajo del segundo. El informe técnico mide 74 casos de prueba de uno a tres minutos, con seis cambios de prompt cada uno, y coloca a Orbis por delante de sistemas en tiempo real como LongLive, Self-Forcing y SANA-Video en calidad perceptual, calidad de movimiento y alineación con el prompt. El catálogo de Visko incluye además Morphe, para modificar personas conservando el fondo, y Kinesis, para añadir o cambiar elementos con control espacio-temporal.
El detalle que más subraya 𝕏 @testingcatalog (Ai News | Testingcatalog) es que cada actualización se integra de forma natural en la escena en curso, sin obligar a empezar de nuevo, algo que cambia la economía de iterar sobre un vídeo.
Desde 𝕏 @reactorworld (Reactor), plataforma donde se distribuye el modelo en exclusiva, el énfasis va a la combinación de vídeo y audio de longitud ilimitada en tiempo real y hasta 4K.
Tras una hora de pruebas, 𝕏 @sergiorocaa (Sergio) describe la experiencia menos como renderizar vídeo y más como manipular una simulación viva, con física y memoria persistente que responden al instante.
El muro que señala 𝕏 @Nozelcode (Roman) es el conocido en estos sistemas: diez segundos aguantan, a los treinta la coherencia se desmorona, y ahí es donde mide el valor de una ejecución sin límite de duración.
Más información:
📎 Visko launches Orbis, a new real-time AI video model
9. Perplexity reparte el trabajo entre nube y Mac
Perplexity ha activado la computación híbrida en Perplexity Computer, su agente de escritorio, para todos los usuarios de la aplicación en Mac. El funcionamiento es sencillo de describir: la tarea arranca en la nube, donde modelos frontera se ocupan de búsqueda, planificación y razonamiento, y los pasos que tocan archivos privados se derivan a un subagente que corre en el propio equipo. El modelo local es PPLX Qwen 3.8 27B, una versión post-entrenada a medida por la compañía, con instalación en un clic y un requisito de 24 GB de memoria como mínimo.
El reparto no lo decide el usuario a mano: un clasificador de datos personales en el dispositivo y una función llamada Privacy Gate determinan, paso a paso, qué información puede salir del Mac. Los ejemplos que maneja la empresa son analíticas médicas, declaraciones de impuestos y documentación legal, es decir, el material que más fricción genera cuando se plantea usar un agente con acceso al disco. El movimiento sitúa a Perplexity en el terreno de la IA en dispositivo que Apple lleva tiempo trabajando, y llega en plena expansión comercial: la compañía ha triplicado ingresos hasta 750 millones de dólares y negocia una ronda que la valoraría en 30.000 millones, con interés de Nvidia según The Information.
Para 𝕏 @camerontstow (Cameron Stow) la promesa que sostiene todo el diseño es literal: la información privada no llega a tocar la nube en ningún momento del proceso.
El apunte práctico lo pone 𝕏 @ai_for_success (Ashutoshshrivastava) al recordar que la configuración es de un clic pero exige 24 GB de memoria en tu Mac, con 32 GB como recomendación real.
Más información:
📎 Hybrid Compute on Apple silicon



