Tehnologie

DeepSeek V4.1 Flash: 552 de miliarde de parametri, 8 miliarde activi, cache mai ieftin cu 60% — și egalează Opus 5

Adrian Kessler

DeepSeek V4.1 Flash funcționează pe o nouă arhitectură pe care compania o numește Causal Encoder-Decoder. Cei 552 de miliarde de parametri sunt distribuiți într-un encoder cu 20 de straturi și un decoder cu 20 de straturi, însă doar 8 miliarde se activează pe token-urile de intrare și 16 miliarde pe cele de ieșire. Acest lucru îl face structural mai eficient decât modelele care activează porțiuni mai mari de parametri pentru fiecare operație — o alegere de design care se reflectă direct în costul de inferență și eficiența memoriei.

Câștigurile de memorie sunt specifice. Cache-ul KV al V4.1 Flash este de 890 de octeți per token, aproximativ un sfert din cel al V4-Flash. Stocarea în FP4 și Compressed Sparse Attention 2 reduc amprenta persistentă a cache-ului la o optime față de generația anterioară. Intrările din cache costă acum 0,003 dolari per milion de token-uri în afara orelor de vârf — cu 60% mai puțin decât la V4-Flash. Intrările fără cache au scăzut cu 33%, iar ieșirile cu 11%.

La benchmark-urile pe care dezvoltatorii le urmăresc cel mai mult, modelul se menține. DeepSWE v1.1 — testul autonom de inginerie software — îi acordă 74,2, ușor în fața lui Opus 5 de la Anthropic cu 74,0 și peste GPT-5.6 Sol cu 73,0. GPQA Diamond obține 90,9. Diferența care iese în evidență este Terminal-Bench 3.0: 30,0 față de 43,3 la Opus 5, o diferență reală în sarcinile care necesită depanare interactivă extinsă.

Viziunea este integrată din faza de pre-antrenare. Anterior, V4 separa viziunea într-o variantă Vision-Exp distinctă. V4.1 Flash le înlocuiește pe ambele cu un singur model construit în jurul DeepSeek-ViT, un encoder antrenat special, co-dezvoltat împreună cu modelul lingvistic de la început. Nivelul multimodal a dispărut — fiecare apel primește implicit viziune.

Fereastra de context este de 1 milion de token-uri, iar ieșirea este limitată la 384 000, suficient pentru analiza documentelor de lungă durată și fluxurile de lucru agentice extinse, fără a fi nevoie de fragmentare. Apelanții API existenți care folosesc vechile ID-uri deepseek-v4-flash și deepseek-v4-flash-vision-exp sunt deja redirecționați către V4.1 Flash. Pe 14 septembrie, traficul DeepSeek V4 Pro trece și el la prețurile Flash.

DeepSeek a descris V4.1 Flash drept „cel mai mic model din noua noastră familie de arhitecturi”. Un V4.1 Pro mai mare, bazat pe aceeași arhitectură Causal Encoder-Decoder, este subînțeles. Dacă menține traiectoria de eficiență a lui Flash, ar extinde raportul performanță-per-dolar al acestei arhitecturi mai sus pe curba benchmark-urilor — în teritoriul ocupat în prezent de modele care costă semnificativ mai mult per milion de token-uri.

Aspectul arhitectural contează dincolo de tabelul de prețuri. Creșterea cache-ului KV este o constrângere principală în rularea modelelor mari cu context lung și se scalează cu fiecare token procesat. Abordarea V4.1 Flash — mai puțini parametri activi, cache comprimat — abordează direct această constrângere. Este un șablon utilizabil pentru implementări cu context lung, nu o optimizare de caz marginal.

Etichete: , , , , ,

Discuție

Există 0 comentarii.