Anthropic esta permitindo oficialmente que los usuarios pagos de Claude ejecuten conversaciones de voz en los modelos Opus y Sonnet esta semana. Esta actualización también presenta los conectores de la aplicación de Claude en el modo de voz, permitiendo a los usuarios acceder mediante voz a Gmail, Google Calendar, Slack, Canva y Notion. El soporte de idiomas se amplía a 11, incluyendo inglés, francés, etc.
El modo de voz de Claude sube de Haiku a Opus/Sonnet
Según reportes de TechCrunch y 9to5Mac, el núcleo de esta actualización es una mejora a nivel de modelos que permite que el modo de voz funcione. Antes, todas las solicitudes de voz se gestionaban mediante Claude Haiku 4.5 (el modelo más pequeño y rápido de Anthropic) para mantener tiempos de respuesta bajos; en la nueva versión, los usuarios pagos pueden elegir los modos de voz Opus o Sonnet para procesar tareas más complejas.
TestingCatalog descubrió, antes del anuncio, que el selector de modo en la interfaz, como control visual, estaba presente en el modo de voz desde hacía aproximadamente tres semanas; sin embargo, hasta esta semana, la selección de Opus o Sonnet no cambiaba realmente el modelo de enrutamiento subyacente. Las cuentas gratuitas siguen limitadas a Haiku y a una aplicación conectada, pero aún pueden tener conversaciones por voz en todos los idiomas compatibles.
Los conectores de aplicaciones entran al modo de voz: cinco herramientas admiten consultas y acciones por voz
Según los reportes de TechCrunch y Engadget, el modo de voz de Claude ahora puede acceder a estas cinco aplicaciones conectadas:
Gmail: redactar o consultar correos mediante instrucciones de voz
Google Calendar: mover o consultar reuniones con voz
Slack: acceder al contexto de los mensajes de Slack
Canva: realizar operaciones con documentos relacionados
Notion: crear documentos de Notion con instrucciones de voz
Tras otorgar permisos, el modo de voz puede obtener información de contexto desde las aplicaciones ya conectadas. Anthropic indica que el enfoque de esta actualización es el de «análisis inteligente y acceso a herramientas», y que las tareas objetivo incluyen ensayar propuestas para clientes, obtener retroalimentación sobre formas de comunicación y realizar investigaciones de productos en voz alta. TechCrunch señala que, en cambio, el modo de voz actualizado de OpenAI cambió el estilo de conversación, pero aún no logra completar tareas usando herramientas.
Turnos en voz de Claude vs GPT-Live escuchando y hablando a la vez
Según la explicación de un representante de Anthropic a TechCrunch, el modo de voz de Claude utiliza un sistema de «turnos»: primero escucha, luego piensa y después habla; GPT-Live admite escuchar y hablar de forma simultánea.
TechCrunch también señaló que esta actualización de Anthropic no cambió el modelo de voz subyacente y que no explicó por completo los detalles técnicos de la pila de voz; según las pruebas de TestingCatalog, Claude sigue generando voz mediante tecnología de texto a voz y la salida de voz proviene de ElevenLabs, pero la función de procesamiento interrumpido funciona correctamente.
Preguntas frecuentes
¿Qué modelos se admiten después de la actualización del modo de voz de Claude?
Según el anuncio de Anthropic, los usuarios pagos ahora pueden elegir Opus, Sonnet o Haiku en el modo de voz, con un selector de modo integrado en la interfaz; las cuentas gratuitas siguen limitadas a Haiku y a una aplicación conectada.
¿Qué conectores de aplicaciones admite el modo de voz de Claude?
Según los reportes de TechCrunch y Engadget, el modo de voz ahora puede acceder a Gmail, Google Calendar, Slack, Canva y Notion, permitiendo a los usuarios realizar acciones en estas aplicaciones mediante instrucciones de voz.
¿En qué difiere la arquitectura del modo de voz de Claude frente a GPT-Live?
Según la explicación del representante de Anthropic, Claude utiliza un sistema de «turnos» (primero escucha y luego habla); GPT-Live admite escuchar y hablar simultáneamente. TechCrunch indica que la actualización del modo de voz de OpenAI cambió el estilo de conversación, pero aún no puede completar tareas usando herramientas mediante voz.