Claude por voz en Opus y Sonnet: la voz se convierte en canal para los agentes
Anthropic ha extendido el modo de voz de Claude a los modelos Opus y Sonnet, ya no solo a Haiku. Ahora puedes hablar con el modelo más potente, cambiar de idioma a mitad de conversación y dejar que Claude redacte emails a través de Gmail, lea tu calendario o escriba en Slack, todo por voz.
Esta jugada llega dos días después de Presence de OpenAI, la plataforma empresarial que reúne voz y chat en un único producto agentico, y del acuerdo AMD-Anthropic por 5.000 millones para 2 gigawatios de GPU MI450. Tres movimientos en la misma semana convergen en un punto: la voz se convierte en el canal por el que opera el agente.
Por qué te importa. Si estás incorporando agentes a tu trabajo, la infraestructura se está solidificando. Modelo, canal de voz y hardware terminan en las mismas manos. Claude hoy es el único que te permite redactar y enviar un email directamente desde la voz. OpenAI y Google tienen un audio más natural (full-duplex frente al sistema por turnos de Claude), pero Anthropic apunta a la integración con tus herramientas.
La limitación es clara: la voz de Claude espera a que termines de hablar antes de responder, y suena menos fluida que GPT-Live. Para quien evalúa qué plataforma adoptar, la elección se reduce a una disyuntiva concreta: naturalidad de la conversación contra control directo de las herramientas.
En detalle
Qué había antes. El modo de voz de Claude funcionaba solo en Haiku, el modelo más ligero de la familia. Rápido en tiempos de respuesta, pero limitado en tareas que requieren razonamiento extenso o redacción cuidada. Ahora Opus y Sonnet están disponibles en app móvil, escritorio y web, y puedes cambiar de modelo a mitad de conversación si necesitas más potencia o más velocidad.
Cómo funciona la voz. Claude usa un sistema por turnos: tú hablas, él espera a que termines, luego responde. Es el mismo esquema que Gemini Live de Google. GPT-Live de OpenAI, en cambio, es full-duplex: habla y escucha simultáneamente, como en una llamada telefónica. En la práctica, GPT-Live y Gemini suenan más natural porque no hay silencios entre intervenciones. Claude compensa con algo que los otros no tienen: acceso directo a tus herramientas de trabajo.
La ventaja que cuenta. Anthropic es actualmente el único proveedor que te permite redactar y enviar un email directamente desde el modo de voz. Si has conectado Gmail, Calendar o Slack, puedes dictar a Claude un mensaje y él lo redacta, lo guarda o lo envía sin que tengas que pasar al teclado. Es la diferencia entre un asistente por voz que responde preguntas y un agente que realiza acciones en tu nombre.
El panorama convergente. Tres movimientos en una semana apuntan en la misma dirección. OpenAI formalizó una plataforma agentica empresarial para voz y chat. Anthropic cerró un acuerdo por 2 gigawatios de GPU MI450 que sostienen el training e inferencia. La voz en Opus es la tercera pieza: el modelo más potente, el canal de voz y el compute para sustentarlo en las mismas manos. Para quien evalúa qué plataforma adoptar, el ecosistema se está consolidando en stacks verticales donde hardware, modelo e interfaz están alineados.
Dónde divergen las fuentes. The Decoder detecta que Claude pierde en naturalidad de voz frente a OpenAI y Google, pero gana en integración de herramientas. Es una disyuntiva real, no una victoria neta. La pregunta abierta es si Anthropic añadirá full-duplex, o si la apuesta es que quienes usan Claude para trabajar prefieren el control directo de las herramientas a la fluidez de la conversación.
Limitaciones. Once idiomas compatibles, pero las fuentes no especifican cuáles ni qué tan bien funcionan los menos comunes. La integración con Gmail, Calendar y Slack requiere permisos explícitos: el patrón de seguridad es correcto, pero en entorno de equipo hace falta definir quién puede conectar qué y qué datos puede leer el agente.