Flux salta de la imagen al vídeo y del vídeo a la robótica
El nuevo modelo de Black Forest Labs genera clips de 20 segundos y guía robots en Audi en colaboración con Mimic Robotics.
¿Qué pasó ayer? En un minuto:
Black Forest Labs presentó FLUX 3, un modelo multimodal que genera vídeo con audio de hasta 20 segundos y movimientos de robots, con Audi probándolo ya en su línea de producción.
OpenAI despliega Health in ChatGPT, que conecta Apple Health y registros médicos de usuarios adultos en EE.UU. para interpretar sus datos de salud.
Offloop abrió la beta privada de su workspace de agentes con un coste por tarea cercano a una quinta parte del de otros sistemas multiagente.
Andrew Ng lanzó OpenWorker, un agente de código abierto agnóstico al modelo que entrega resultados acabados en tareas de escritorio.
OpenAI introduce el modelo de voz más avanzado GPT-Live en la app de escritorio que aglutina ChatGPT Work y Codex.
Microsoft presentó MAI-Image-2.5-Pro y MAI-Voice-2-Flash, sustituye modelos de terceros en sus productos y logra ahorros de GPU de hasta el 89%.
Anthropic amplió el modo de voz de Claude a Opus y Sonnet, con acceso directo a herramientas mediante conectores.
Alibaba lanzó Qwen-Audio-3.0-TTS, con etiquetas inline de expresión, 16 idiomas y el primer puesto en el ranking de Artificial Analysis.
Gracias por leer 1 Minuto de IA. Si te ha gustado esta edición, no te olvides de dar al ♡ y de compartirla por redes sociales o por email con otras personas a las que creas que les pueda interesar.
Y si tienes más de un minuto…
1. Black Forest Labs presenta FLUX 3 multimodal
Black Forest Labs, el laboratorio alemán conocido por sus modelos de generación de imagen, ha abierto el acceso anticipado a FLUX 3, un modelo capaz de generar y editar imágenes, vídeo y audio desde una arquitectura común. La versión de vídeo produce clips de hasta 20 segundos con sonido nativo y admite texto, imágenes o vídeos como referencia, además de diálogo multilingüe y secuencias enlazadas. La compañía asegura que sus evaluaciones preliminares muestran preferencia frente a los principales competidores en este área. Pero los resultados son internos, el sistema continúa en desarrollo y aún no hay detalles técnicos suficientes para verificarlos de forma independiente.
A la vez presenta FLUX-mimic, un modelo basado en el mismo motor que convierte la predicción de vídeo en movimientos de robot, desarrollado por la empresa suiza Mimic Robotics. Se apoya en FLUX 3, y Audi ya lo prueba en tareas reales de producción: montaje de juntas, cables y otras piezas flexibles que la automatización convencional no ha podido asumir, en buena parte porque reprogramar celdas robóticas para cada variante sale demasiado caro. Según Mimic, el sistema funciona en el propio robot con una sola GPU RTX 5090 y responde en unos 101 milisegundos, cerca del tiempo de reacción visual humano. En una prueba interna de preparación de bandejas con piezas blandas, una versión preliminar alcanzó un 95% de aciertos frente al 55% de una alternativa del sector adaptada a sus datos.
El despliegue es escalonado: vídeo por API y pesos privados para socios iniciales; acción, con clientes seleccionados de robótica; imagen, en las próximas semanas; y una versión abierta, FLUX 3 Dev, más adelante en 2026. Con este movimiento Black Forest Labs deja de competir solo en la generación audiovisual y entra en el mercado de la automatización industrial.
Para 𝕏 @AndrewCurran_ (Andrew Curran), los rumores del día anterior se han confirmado: modelo plenamente multimodal y generaciones de 20 segundos, con un equipo del que espera un resultado potente.
𝕏 @Nekodificador (Nekodificador) anticipa la distribución habitual del sector: modelos pesados en la nube vía API y una versión destilada para GPUs de consumo, y califica el resultado de sobresaliente.
El ángulo que subraya 𝕏 @rohanpaul_ai (Rohan Paul) es la robótica: frente a los modelos visión-lenguaje-acción entrenados con imágenes y texto estáticos, FLUX 3 podría aportar nociones de contacto, deformación y causalidad temporal.
𝕏 @giffmana (Lucas Beyer (Bl16)) valora la colaboración entre BFL y mimic como una buena combinación, y en otro mensaje apunta a la mano robótica del cierre de la demostración como guiño deliberado.
Más información:
📎 FLUX 3 - Real World Models
📎 FLUX 3 x mimic: The Next Generation of Video-Action Models
2. OpenAI conecta ChatGPT con tus datos médicos
OpenAI ha empezado a desplegar ‘Health in ChatGPT’, una función para usuarios adultos en Estados Unidos que permite conectar Apple Health y registros médicos compatibles. Con ello, el modelo interpreta la información personal en contexto, sigue su evolución y compara resultados nuevos con pruebas anteriores. La compañía afirma que más de 300 millones de personas consultan ChatGPT cada semana con preguntas de salud, un volumen que explica por qué quiere formalizar esas respuestas en lugar de dejarlas al uso improvisado.
Según OpenAI, la experiencia se ha construido con el feedback de testers iniciales y la colaboración de cientos de médicos, con el objetivo de medir precisión, seguridad y calidad de la comunicación. El acceso a los datos requiere permiso explícito del usuario en cada caso. La integración de datos sensibles eleva a la vez la utilidad del asistente y su exposición en privacidad y fiabilidad clínica. Aquí conviene indicar que aunque un asistente que interpreta analíticas no equivale a un diagnóstico, sí puede ayudar a detectar problemas de salud antes de que sea muy tarde.
El equipo de 𝕏 @OpenAI (Openai) insiste en que el contexto conectado sirve para tareas concretas, como comparar un resultado nuevo con pruebas previas o resumir cambios desde la última consulta, no para sustituir el criterio médico.
𝕏 @gdb (Greg Brockman) recurre al ejemplo personal para presentar la función y se cuenta a sí mismo y a su mujer entre quienes ya usan ChatGPT para dudas de salud.
𝕏 @testingcatalog (Ai News | Testingcatalog) señala el matiz que más pesa: la novedad no son las respuestas, sino que el modelo se apoya ahora directamente en los registros médicos y los datos de Apple Health del usuario.
El ‘OpenAI acaba de resolver la medicina’ de 𝕏 @tunguz (Bojan Tunguz) funciona como recordatorio irónico del exceso de expectativa que acompaña a estos lanzamientos.
Más información:
📎 Launching Health in ChatGPT
3. Offloop lanza su workspace de agentes
Offloop, producto de la estadounidense Intelligence Software, abrió su beta privada por invitación. Su propuesta: en lugar de encargar tareas sueltas a un chatbot, el usuario define un objetivo y unos límites, y un equipo de agentes ejecuta el trabajo, retoma lo que queda en espera y solo devuelve a la persona las decisiones que requieren su autoridad.
La pieza distintiva es D1, un modelo despachador ligero que decide en cada paso qué agente actúa, cuándo seguir, cuándo parar y cuándo quedarse al margen. Busca resolver un fallo habitual de los sistemas multiagente: que todos hablen a la vez y el canal se llene de ruido. Offloop conecta con Notion, GitHub, GitLab, Sentry, Supabase, Vercel, Railway, Cursor y Codex, y los equipos pueden usar su propia suscripción de IA o la infraestructura de Offloop. El producto apunta a equipos pequeños que gestionan lanzamientos, seguimiento de clientes, investigación o feedback, donde el trabajo se atasca no por la dificultad sino por la falta de continuidad.
La compañía, de cuatro personas, afirma haber alcanzado un 84,9% en GDPval, el test de OpenAI sobre trabajo real en 44 ocupaciones, y un 67,2% en JobBench, con un coste por tarea cercano a la quinta parte del de los sistemas multiagente con los que se comparó. Son datos facilitados por la propia empresa y sin verificación independiente: Offloop no aparece en la clasificación pública de GDPval-AA de Artificial Analysis, encabezada hoy por Claude Fable 5.
Lo que más valora 𝕏 @kimmonismus (Chubby) es que Offloop haya construido una capa dedicada al problema recurrente: la mayoría de montajes multiagente mueren cuando todos los agentes hablan a la vez y el canal se convierte en ruido.
Para 𝕏 @rohanpaul_ai (Rohan Paul), el caso confirma una tendencia que ve en la investigación reciente: el ‘harness’, la orquestación, se está convirtiendo en la verdadera capa de capacidad, por encima del modelo base.
El dato que 𝕏 @testingcatalog (Ai News | Testingcatalog) rescata del titular es el coste: el sistema opera a cerca de un quinto del gasto de otras aproximaciones multiagente frontera.
Para 𝕏 @madzadev (Madza) marca la diferencia frente a la competencia: la mayoría de herramientas multiagente siguen pareciendo un chatbot con pasos extra, mientras que aquí agentes y personas comparten de verdad el mismo espacio, canales, archivos e historial.
Más información:
📎 Introducing Offloop
4. Andrew Ng lanza OpenWorker, agente de escritorio
Andrew Ng ha presentado OpenWorker, un agente de código abierto que corre en el escritorio del usuario y entrega resultados, no conversaciones. La idea es pedir un desenlace, no una respuesta: preparar un customer brief, ordenar el calendario, redactar un informe o revisar el estado de una release en Jira y GitHub. El agente descompone la tarea, actúa sobre archivos y aplicaciones conectadas (Slack, correo, calendario, CRM) y devuelve el entregable acabado.
Antes de cualquier acción con consecuencias consulta al usuario mediante una capa de aprobación tipada, integrada en la lógica del agente y no añadida sobre la interfaz. El diseño es local-first y no impone un modelo: admite claves propias de OpenAI, Anthropic o Google, proveedores de pesos abiertos, o ejecución totalmente local con Ollama. Los datos solo salen a través del modelo y las integraciones que se elijan. El proyecto está en GitHub bajo la cuenta de Ng, en beta abierta y con actualizaciones automáticas.
El propio 𝕏 @AndrewYNg (Andrew Ng) resume la diferencia en que OpenWorker no charla, sino que entrega: te pasa un documento pulido, envía un mensaje de Slack o actualiza una entrada del calendario.
Para 𝕏 @Marktechpost (Marktechpost Ai) el detalle que distingue al proyecto es que la capa de aprobación es tipada, no cosmética, frente a los agentes de escritorio que atornillan las confirmaciones sobre la interfaz.
Desde fuera del ámbito angloparlante, 𝕏 @cattodata (Catto Data) recoge el interés inmediato y pone el foco en los casos concretos: preparar un customer brief, ordenar el calendario o redactar un informe.
𝕏 @MLBear2 (Ml_Bear) lo incluye en su repaso diario junto a los lanzamientos de voz de ChatGPT y Claude, leyéndolo como una pieza más del empuje agéntico de la semana.
Más información:
📎 OpenWorker — AI that gets your everyday tasks done
5. OpenAI lleva ChatGPT Voice al escritorio
OpenAI ha añadido ChatGPT Voice a su aplicación de escritorio con un giro respecto al chat de voz habitual: la voz pasa a ser un mecanismo para controlar el ordenador. Desde la app, el usuario puede iniciar, supervisar y redirigir varios agentes en ChatGPT Work y Codex sin teclear. La función se apoya en GPT-Live, un modelo full-duplex capaz de hablar, escuchar y coordinar tareas a la vez. La idea es acercar la voz al trabajo agéntico real, usándola como capa de orquestación cuando hay varios procesos en marcha, más allá de la conversación.
El despliegue empezó en macOS a escala global; según se ha documentado, arrancó con retraso pero ya cubre a todos los usuarios. ChatGPT Voice también funciona en Codex desde la app de iOS mediante acceso remoto emparejado; el soporte para Android está anunciado, pero aún no disponible.
Para 𝕏 @OpenAI (Openai) la clave es dirigir varios agentes a la vez dentro de la app, con GPT-Live gestionando escucha y coordinación en simultáneo, no como un simple dictado.
𝕏 @WesRoth (Wes Roth) lo describe como convertir ChatGPT Voice en un sistema de control del ordenador: hablas mientras el modelo lanza tareas, comprueba el progreso y reorienta agentes en marcha.
𝕏 @gdb (Greg Brockman) apunta al argumento de fondo de la interfaz: usar la voz hace evidente lo poco natural que resulta teclear para este tipo de tareas.
𝕏 @kimmonismus (Chubby) había apostado por una jornada mayor, con rumores de Codex con voz en tiempo real, GPT-5.6 en Cerebras a 750 tok/s e incluso un Opus 5, expectativas que el anuncio real no cubrió.
𝕏 @victorianoi (Victoriano Izquierdo) sitúa el objetivo deseable en Codex con voz corriendo en segundo plano desde el móvil mientras uno se mueve por la calle, más allá del uso en escritorio.
6. Microsoft amplía su familia MAI con imagen y voz
Microsoft ha presentado dos modelos de su familia MAI, ambos en vista previa pública. MAI-Image-2.5-Pro es su modelo de imagen de mayor fidelidad hasta la fecha, orientado a visuales profesionales, edición detallada y renderizado preciso de texto dentro de la imagen. Está disponible en Foundry, a 5 dólares por millón de tokens de texto de entrada y 8 dólares por millón de tokens de imagen de entrada. MAI-Voice-2-Flash duplica la velocidad de MAI-Voice-2 con un coste un 32% menor, situado en 15 dólares por millón de caracteres.
El punto relevante es la lógica de negocio para Microsoft, que envía las llamadas de sus productos hacia modelos propios cuando estos igualan la calidad frontera en una tarea concreta, con prioridad en velocidad y coste. Microsoft afirma que Bing Image Creator funciona ahora íntegramente con modelos propios; que su uso en PowerPoint reduce el coste de GPU hasta un 84% frente a GPT-Image-2, de OpenAI; y que en Dynamics 365 Contact Center, con clientes como T-Mobile y EasyJet, el ahorro alcanza el 89%. Con los modelos de la familia MAI, Microsoft pretende reducir su dependencia de modelos de terceros dentro de sus propios servicios.
La tesis de 𝕏 @mustafasuleyman (Mustafa Suleyman) es clara: Microsoft está desplegando modelos MAI más rápidos y baratos por todo su ecosistema, con el ahorro en PowerPoint y OneDrive como prueba de que la sustitución interna ya rinde.
El foco de 𝕏 @rohanpaul_ai (Rohan Paul) está en la eficiencia: los modelos MAI superarían a los de propósito general en muchas tareas usando una fracción de los tokens, y atribuye buena parte del mérito al 'harness' que los rodea.
𝕏 @WesRoth (Wes Roth) subraya que Microsoft cubre ahora extremos opuestos del espectro dentro de la misma familia: máxima fidelidad en imagen por un lado y velocidad económica en voz por otro.
𝕏 @testingcatalog (Ai News | Testingcatalog) recoge el dato que suele quedar fuera de los titulares: el coste de salida de imagen del modelo Pro asciende a 106 dólares por millón de tokens, muy por encima de los precios de entrada.
Más información:
📎 Introducing MAI-Image-2.5-Pro and MAI-Voice-2-Flash
7. Claude lleva su modo de voz a Opus y Sonnet
Anthropic ha actualizado el modo de voz de Claude, que hasta ahora corría solo sobre el modelo ligero Haiku, para admitir también Opus y Sonnet (se citan Opus 4.8 y Sonnet 5). El usuario elige modelo desde un selector y ajusta el nivel de razonamiento dentro de la propia conversación hablada, algo útil para tareas que Haiku no sostenía bien por su capacidad limitada de razonamiento prolongado.
El cambio con más recorrido no es el salto de modelo, sino que la voz deja de ser solo conversación: incorpora acciones a través de conectores. Desde el modo de voz, Claude accede al correo, el calendario, Notion y documentos, y puede llegar a programar y desplegar en Vercel sin teclear. Se añade soporte multilingüe (español, francés, hindi y japonés) y disponibilidad en móvil, escritorio y web, en beta pública desde el día del anuncio. El calendario del lanzamiento no fue casual: llegó casi en paralelo a una actualización del modo de voz de OpenAI (ChatGPT en escritorio y voz en tiempo real en Codex), con pocos minutos de diferencia. Los modos de voz con acceso real a aplicaciones se perfilan como el próximo terreno de disputa entre ambos.
El punto que subraya 𝕏 @rohanpaul_ai (Rohan Paul) es el cambio de familia de modelos: pasar de un Haiku rápido pero corto de razonamiento a Opus y Sonnet abre la voz a tareas que antes se atascaban.
𝕏 @rileybrown (Riley Brown) resume el salto en lo concreto: acceder al correo, tocar documentos y Notion, e incluso hacer vibecoding y desplegar en Vercel directamente desde la voz.
Para 𝕏 @0xJokker (Jokker), lo distintivo no es hablar con una IA, sino hablar con algo que tiene acceso en tiempo real a tus herramientas, un matiz que separa esta versión de un asistente de voz convencional.
𝕏 @dashboardlim (Lian Lim | Dashboard & Ai Automation Expert) lee la coincidencia de horarios como una carrera abierta: Claude sacó su mejora de voz y OpenAI hizo lo propio minutos después, algo que no atribuye al azar.
8. Alibaba lanza Qwen-Audio-3.0-TTS en dos versiones
El equipo Qwen de Alibaba ha presentado Qwen-Audio-3.0-TTS, un modelo de texto a voz en dos variantes: Flash, para interacción en tiempo real, y Plus, para generación de alta calidad. Su rasgo distintivo son las etiquetas inline de grano fino, que insertan expresión en el propio texto con marcas como [whisper], [angry], [breaths] o [laughs]. El sistema cubre 16 idiomas y 20 variantes dialectales del chino, admite instrucciones en lenguaje natural y sintetiza fragmentos de hasta tres minutos en una sola pasada.
Según el artículo de Alibaba, obtiene resultados de primer nivel en varias evaluaciones y lidera el leaderboard independiente de Artificial Analysis. La documentación de Alibaba Cloud lo describe como producto listo para producción: síntesis en streaming por WebSocket, clonación y diseño de voz, control de velocidad, tono y volumen, y salida hasta 48 kHz. Los modelos ya están disponibles en OpenRouter, lo que reduce la fricción de adopción. La clonación funciona a partir de un clip de referencia corto, incluso con muestras ruidosas o con reverberación, y la versión Flash apunta a unos 300 ms de latencia de primer paquete.
El equipo de 𝕏 @Alibaba_Qwen (Qwen) coloca las etiquetas inline como argumento central: dirigen susurros, enfado, respiraciones y risas sin salir del texto.
Con ambas versiones ya operativas en su plataforma, 𝕏 @OpenRouter (Openrouter) subraya la combinación de 16 idiomas con dirección en lenguaje natural mediante señales como [gasp] o [giggles].
𝕏 @TechBuzzChina (Tech Buzz China) señala que el modelo se situó primero en el ranking de Artificial Analysis nada más salir, y sitúa la versión Flash en torno a 300 ms de primer paquete.
Para 𝕏 @filicroval (Filipe), con modelos TTS mejorando y abaratándose a este ritmo cuesta ver cómo ElevenLabs mantiene competitividad y márgenes.
Más información:
📎 Qwen-Audio-3.0-TTS



