article

DeepSeek V4.1 Flash corta cache e sai com licença MIT

3 min de leitura

🎬 Assista esta matéria

A DeepSeek lançou em 10 de setembro de 2026 o DeepSeek-V4.1-Flash, modelo multimodal de mistura de especialistas com 552 bilhões de parâmetros no tronco principal e janela de contexto de 1 milhão de tokens. Os pesos foram publicados no Hugging Face sob licença MIT, a mais permissiva entre as usadas em modelos abertos.

O ponto central do anúncio não é o tamanho, e sim o custo de memória. A empresa afirma que o cache de chaves e valores — a estrutura que guarda o contexto já processado para não recalcular tudo a cada passo — caiu para 890 bytes por token. É cerca de um quarto do que o DeepSeek-V4-Flash consumia na memória da GPU, e aproximadamente um oitavo na hora de guardar esse cache em disco.

Onde a economia aparece

A redução vem de duas mudanças. A primeira é a quantização em FP4, que representa cada valor do cache com menos bits. A segunda é uma arquitetura que a DeepSeek chama de codificador-decodificador causal: as 40 camadas do modelo foram divididas em um codificador de 20 camadas e um decodificador que deriva suas chaves e valores da saída do codificador, em vez de calcular tudo de novo. Segundo a empresa, isso corta quase pela metade o custo da fase de leitura do prompt.

Na inferência, o modelo ativa 8 bilhões de parâmetros ao processar a entrada e 16 bilhões ao gerar a saída — números baixos para um tronco de 552 bilhões, o que é o objetivo de uma arquitetura de especialistas.

Esse tipo de economia pesa mais em agentes, que rodam por horas, acumulam contexto longo e guardam estados intermediários entre chamadas. É exatamente o cenário em que o cache vira o item mais caro da conta.

Preço e migração forçada

A nova tabela passou a valer às 4h UTC do dia 10 de setembro: US$ 0,15 por milhão de tokens de entrada sem cache, US$ 0,60 por milhão de tokens de saída e US$ 0,003 por milhão de tokens de entrada já em cache no horário de menor demanda, quando as tarifas caem à metade. O modelo aparece na API como deepseek-flash.

A DeepSeek também marcou uma migração: a partir das 4h UTC de 14 de setembro, todas as chamadas ao deepseek-v4-pro passam a ser roteadas para o V4.1-Flash, já cobradas pela tabela do novo modelo.

Sobre desempenho, a empresa e análises independentes apontam que o V4.1-Flash supera o Claude Opus 5 e o GPT-5.6 Sol no Terminal-Bench 2.1 e no DeepSWE v1.1, dois testes voltados a tarefas de terminal e engenharia de software. Os resultados variam conforme o conjunto de avaliação, e não há, até agora, verificação independente ampla dessas marcas.

Para quem desenvolve no Brasil, o efeito prático é de preço: um modelo de topo com pesos abertos e cobrança na casa de centavos por milhão de tokens de entrada muda a conta de qualquer projeto que dependa de contexto longo.

Fontes: DeepSeek, MarkTechPost, VentureBeat

🎙️ Gostou? Receba só o que te interessa, todo dia

Escolha seus temas e receba um briefing diário em áudio e texto, de graça, no WhatsApp ou e-mail.

Montar meu briefing grátis