Radar · 04/08/2026 · ocurrido el 03/08/2026 · modelos

GPT-Live: OpenAI documenta la arquitectura que elimina los turnos de la voz

OpenAI publica el análisis técnico profundo de GPT-Live, el sistema que habilita la voz continua en agentes. El modelo escucha y habla en el mismo flujo, sin turnos de conversación, con una arquitectura construida en seis meses para reducir la latencia por debajo del umbral de la conversación natural.

Por qué te importa. Si evalúas o construyes agentes de voz, ahora tienes la base técnica documentada de lo que ya está en producción. El 2 de agosto contábamos sobre avatarin, que puso a 30.000 clientes hablando con un agente de voz basado en GPT-Realtime en las tiendas Yamada Denki. GPT-Live describe la arquitectura que está debajo de ese tipo de sistema: qué significa eliminar los turnos de la voz, qué latencia se necesita, qué compensaciones implica.

La diferencia entre voz con turnos y voz continua es la diferencia entre un walkie-talkie y una llamada telefónica. El primero te obliga a decir “adelante”, esperar, responder. El segundo permite que las palabras se superpongan, que interrumpas, que el interlocutor reaccione mientras aún hablas. Para un agente que asiste a un cliente por teléfono o en tienda, este es el umbral que separa una demo de una herramienta utilizable.

El documento llega mientras la voz se consolida como canal operativo para los agentes: Anthropic extendió la modalidad de voz a Opus y Sonnet, y OpenAI Presence apunta a la voz en la plataforma empresarial.

En detalle

La conversación de voz con una IA tiene un problema que el texto no tiene: la latencia. Cuando escribes en chat, una espera de un segundo es normal. Cuando hablas por teléfono, un segundo de silencio después de tu frase suena como un vacío, y dos segundos suenan como si el interlocutor no estuviera escuchando.

Los sistemas de voz tradicionales resuelven el problema por fases: graban el audio, lo convierten en texto, generan una respuesta textual, la convierten en voz, la reproducen. Cada fase agrega latencia, y el turno es rígido: tú hablas, la IA calla, luego la IA habla y tú callas. Es el modelo del walkie-talkie.

Qué cambia con GPT-Live. El sistema descrito por OpenAI elimina la estructura de turnos. El modelo escucha el audio en streaming y genera voz en streaming, en el mismo flujo continuo. Esto significa que el agente puede comenzar a responder antes de que termines de hablar, puede ser interrumpido, y puede manejar superposiciones como lo haría una persona en una llamada. El documento describe la arquitectura construida en seis meses para lograr este resultado, con el objetivo explícito de mantener la latencia por debajo del umbral de percepción.

Para un no ingeniero. El salto técnico está en conectar directamente el audio entrante al audio saliente, sin pasar por la transcripción como paso separado. El modelo procesa fragmentos de voz en lugar de fragmentos de palabras escritas. La arquitectura debe manejar el flujo bidireccional en tiempo real, bufferizar lo suficiente para no perder palabras, y mantener la latencia constante incluso cuando la carga varía.

La conexión con avatarin. El caso de avatarin en las tiendas Yamada Denki, contado el 2 de agosto, es la primera demostración a escala real de un agente de voz basado en GPT-Realtime en producción 24/7, con 30.000 clientes y una satisfacción declarada del 92%. Lo que faltaba era la documentación de la arquitectura subyacente. Ahora existe: quien evalúe construir un sistema similar tiene una referencia técnica en lugar de un caso de estudio de marketing.

Los límites de lo que se conoce. El documento publicado por OpenAI es un análisis técnico profundo, pero del extracto se conocen el enfoque general y los resultados, no todos los detalles de implementación. Las métricas de latencia específicas, los costos por minuto de conversación, y las comparaciones directas con sistemas competidores (como la modalidad de voz de Claude en Opus y Sonnet) no emergen del resumen. Lo que se sabe es que el sistema existe, funciona en producción, y OpenAI eligió documentar su arquitectura. Lo que no se sabe es cuán replicable es por terceros con herramientas abiertas, e qué infraestructura de computación requiere para soportar la carga de una distribución masiva.

Para quien sigue el hilo de la voz como canal operativo de los agentes, GPT-Live es la pieza técnica que avatarin daba por hecho y que Anthropic introdujo sin documentar. Ahora la referencia existe.

Escribe para buscar en curso, playbooks, skills, papers…