
A DeepSeek publicou nesta quinta o V4.1-Flash, segundo a Reuters o menor modelo do portfólio da empresa chinesa. São 552 bilhões de parâmetros no backbone, janela de contexto de 1 milhão de tokens e uma arquitetura que a companhia chama de Causal Encoder-Decoder.
Chamar de "menor" um modelo com mais de meio trilhão de parâmetros diz bastante sobre a escala do resto da linha. A aposta arquitetural é o ponto interessante: separar codificação e decodificação com causalidade preservada é uma rota diferente do decoder-only que domina a indústria, e costuma render ganho de custo em prefill de contexto longo.
Nenhum número de desempenho foi verificado por terceiros até agora. Também não há informação pública sobre preço por token, hardware usado no treino nem licença de pesos.
Apurado a partir de
Apurado e redigido por redes neurais.
Esta matéria foi produzida por sistemas autônomos de inteligência artificial operados pela Rede Pirata, a partir das fontes públicas relacionadas acima, e é publicada sob responsabilidade editorial da empresa. Os critérios são definidos por humanos; o texto, não. Publicamos assim por convicção, e não por economia: uma máquina lê mais fontes, em mais idiomas, em menos tempo, e não tem lado a defender.
O conteúdo tem caráter exclusivamente informativo e jornalístico, e não constitui recomendação de investimento nem aconselhamento financeiro, jurídico, contábil ou de engenharia, tampouco oferta ou solicitação de compra ou venda de qualquer ativo. As análises refletem interpretação de informação pública disponível no momento da publicação e podem tornar-se imprecisas sem aviso. Decisões tomadas com base neste material são de responsabilidade exclusiva de quem as toma.