DeepSeek V4.1 Flash: nova arquitetura — desempenho superior ao do topo de gama com custos reduzidos
Descubra novas tecnologias, inteligência artificial, drones, mobilidade, eletrónica, navegação e inovações digitais

A 10 de setembro de 2026, a DeepSeek lançou oficialmente o modelo DeepSeek V4.1 Flash. É o modelo mais compacto da nova geração de arquitetura, mas conta com capacidade multimodal nativa para compreender imagens e supera os modelos de topo, incluindo o V4 Pro, em vários testes importantes.
Uma nova arquitetura assimétrica: custos reduzidos e elevado nível de inteligência
O V4.1 Flash utiliza uma arquitetura MoE com 552 mil milhões de parâmetros e uma estrutura Causal-Encoder-Decoder totalmente nova. A sua principal característica é a assimetria entre a entrada e a saída: ao processar os dados de entrada, são ativados apenas 8 mil milhões de parâmetros, enquanto na geração da resposta são ativados 16 mil milhões, o que torna o modelo significativamente mais económico do que outros de dimensão semelhante.
O modelo é composto por 40 camadas Transformer: as primeiras 20 formam o encoder causal e as últimas 20 o decoder. A cache KV global do decoder é projetada diretamente a partir da última camada do encoder, reduzindo significativamente a carga de processamento durante a etapa de prefill.
Cache comprimida ao máximo e custos significativamente mais baixos
A nova geração alcançou um avanço importante na eficiência da cache KV: em comparação com a anterior V4 Flash, a necessidade de HBM foi reduzida 4 vezes e a de SSD 8 vezes. Segundo o fabricante, face à primeira geração V1, o volume da cache KV foi reduzido 437 vezes.
Isto é especialmente importante em cenários com agentes, onde os custos associados aos acessos à cache representam uma parte significativa das despesas, e a sua compressão reduz diretamente o custo de utilização.
Desempenho superior ao modelo de topo
Nos benchmarks, o V4.1 Flash superou o V4 Pro em termos de capacidade de raciocínio. No teste Terminal-Bench 2.1, o novo modelo obteve 90.6 pontos, contra 87.9 do V4 Pro e 82.7 do anterior V4-Flash. No mais complexo Terminal-Bench 3.0, a diferença tornou-se ainda mais expressiva: 30.0 contra 11.8 e 7.6, respetivamente.
No DeepSWE v1.1 desenvolvimento de software, o resultado foi de 74.2 contra 62.7 do V4 Pro. No ranking do Codeforces, o modelo alcançou 3471 pontos, superando os 3348 do V4 Pro. Na área da cibersegurança CyberGym, obteve 88.1 contra 83.3.
Assim, no trabalho com terminais, geração de código e cibersegurança, que são cenários fundamentais para agentes, o V4.1 Flash supera claramente os modelos anteriores.
API e preços
O V4.1 Flash já está disponível através da API da DeepSeek: basta indicar o nome do modelo deepseek-flash. Os preços também foram reduzidos: durante as horas de menor procura, a entrada com acerto na cache custa cerca de 0,0026 euros, a entrada sem acerto cerca de 0,13 euros e a saída cerca de 0,51 euros. Durante as horas de maior procura, o preço é duas vezes superior, enquanto nas horas de menor procura é duas vezes inferior.
Os antigos V4 Flash e V4 Flash Vision Exp foram desativados, mas, por motivos de compatibilidade, os nomes antigos dos modelos são temporariamente redirecionados para o V4.1 Flash.
E o V4 Pro
Segundo os dados mais recentes, em resposta aos pedidos dos utilizadores, a DeepSeek decidiu continuar a disponibilizar a API do V4 Pro depois de 14 de setembro, mantendo os mesmos preços. Inicialmente, estava previsto redirecionar automaticamente os pedidos do V4 Pro para o V4.1 Flash.
Para os leitores que acompanham a área da construção e da impressão 3D, a capacidade multimodal nativa do V4.1 Flash é particularmente interessante: o modelo pode reconhecer diretamente desenhos técnicos de construção, fotografias de equipamentos ou imagens do progresso dos trabalhos, abrindo novas possibilidades para o processamento de documentação de engenharia.
Fonte: deepseek.com