A Anthropic permitiu oficialmente esta semana que os utilizadores pagos do Claude executem conversas de voz nos modelos Opus e Sonnet. Esta atualização também introduz no modo de voz os conectores da aplicação do Claude, permitindo que os utilizadores acedam por voz ao Gmail, Google Calendar, Slack, Canva e Notion. As línguas suportadas alargam-se a 11, incluindo inglês, francês e outras.
O modo de voz do Claude passa de Haiku para Opus/Sonnet
De acordo com as reportagens da TechCrunch e da 9to5Mac, o ponto central desta atualização é uma melhoria na camada de modelos que o modo de voz consegue executar. Até agora, todas as solicitações de voz eram processadas pelo Claude Haiku 4.5 (o modelo mais pequeno e mais rápido da Anthropic) para manter tempos de resposta baixos; a nova versão permite que os utilizadores pagos escolham o modo de voz Opus ou Sonnet, para processar tarefas mais complexas.
O TestingCatalog descobriu, antes do anúncio ser publicado, que o selector de modo na interface, enquanto elemento visual, já existia no modo de voz há cerca de três semanas, mas só nesta semana é que a escolha de Opus ou Sonnet alterou verdadeiramente o modelo de routing subjacente. As contas gratuitas continuam limitadas a Haiku e a uma única aplicação ligada, mas ainda assim podem fazer conversas por voz em todas as línguas suportadas.
Conectores de aplicações entram no modo de voz: cinco ferramentas suportam consultas e ações por voz
De acordo com as reportagens da TechCrunch e da Engadget, o modo de voz do Claude já pode aceder às seguintes cinco aplicações conectadas:
Gmail: redigir ou consultar e-mails com instruções por voz
Google Calendar: mover ou consultar reuniões por voz
Slack: aceder ao contexto das mensagens no Slack
Canva: operações relacionadas com documentos
Notion: criar documentos no Notion com instruções por voz
Depois de os utilizadores concederem permissões, o modo de voz pode obter informações de contexto a partir das aplicações já conectadas. A Anthropic afirma que esta atualização se centra em “análise inteligente e acesso a ferramentas”, com tarefas-alvo que incluem ensaiar propostas a clientes, obter feedback sobre formas de comunicação e fazer uma investigação ao produto em voz alta. A TechCrunch salienta que, em contraste, o modo de voz atualizado da OpenAI alterou o estilo de conversa, mas continua sem conseguir concluir tarefas usando ferramentas.
Falar em turnos no Claude vs GPT-Live a ouvir em simultâneo
Segundo uma explicação do representante da Anthropic à TechCrunch, o modo de voz do Claude utiliza um “sistema de alternância de turnos”: primeiro ouve, depois pensa e, por fim, fala; o GPT-Live suporta ouvir e falar em simultâneo.
A TechCrunch acrescenta ainda que, nesta atualização, a Anthropic não alterou o modelo de voz subjacente e não explicou por completo os detalhes técnicos da pilha de voz; de acordo com testes do TestingCatalog, o Claude continua a usar tecnologia de texto-para-voz para gerar áudio, e a saída de voz vem da ElevenLabs, mas o funcionamento da função de processamento interrompido está normal.
Perguntas frequentes
Que modelos são suportados após a atualização do modo de voz do Claude?
De acordo com o anúncio da Anthropic, os utilizadores pagos podem agora escolher Opus, Sonnet ou Haiku no modo de voz, com um selector de modo incorporado na interface; as contas gratuitas continuam limitadas a Haiku e a uma aplicação ligada.
Que conectores de aplicações são suportados no modo de voz do Claude?
De acordo com as reportagens da TechCrunch e da Engadget, o modo de voz já pode aceder ao Gmail, Google Calendar, Slack, Canva e Notion, permitindo que os utilizadores executem ações nestas aplicações com instruções por voz.
Quais são as diferenças de arquitetura entre o modo de voz do Claude e o GPT-Live?
De acordo com a explicação do representante da Anthropic, o Claude adota um “sistema de alternância de turnos” (ouvir primeiro), enquanto o GPT-Live suporta ouvir e falar em simultâneo; a TechCrunch indica que a atualização do modo de voz da OpenAI alterou o estilo de conversa, mas ainda não permite concluir tarefas através de ferramentas usando voz.