A Google desenvolve o modo de voz Gemini Live e o raciocínio profundo da IA.
Descubra novas tecnologias, inteligência artificial, drones, mobilidade, eletrónica, navegação e inovações digitais

A Google continua a expandir as capacidades da sua linha de inteligência artificial de referência , a Gemini 2.0 , centrando-se na combinação de interação por voz em tempo real e análise lógica profunda. As funcionalidades mais recentes do ecossistema permitem que a IA realize cálculos complexos de várias etapas diretamente durante o diálogo com o utilizador.
O modo de voz interativo Gemini Live permite uma conversação em tempo real com latência mínima. Os utilizadores podem interromper o algoritmo a meio de uma frase, mudar de assunto ou transmitir vídeo a partir da câmara do seu dispositivo. O sistema ajusta a entoação e as emoções, criando um efeito de fala humana natural.
Paralelamente, os programadores estão a desenvolver a tecnologia *Extended Thinking *, apresentada no modelo Gemini 2.0 Flash Thinking . Através de mecanismos de *Chain-of-Thought* (cadeia de raciocínio), o modelo elabora um plano interno de resposta, verifica hipóteses e corrige os seus próprios erros. Isto reduz significativamente a ocorrência de alucinações na resolução de problemas de programação, matemática e análise.
A sinergia entre algoritmos de interação por voz e capacidades de raciocínio profundo marca uma nova etapa no desenvolvimento da IA. Agora, os utilizadores podem obter respostas precisas a questões analíticas sem atrasos nem pedidos de texto complexos.
Fonte: Blog da Google