DeepSeek V4.1 Flash: performancë më e lartë dhe kosto më të ulëta


Më 10 shtator 2026, DeepSeek prezantoi zyrtarisht modelin DeepSeek V4.1 Flash. Ky është modeli më kompakt i gjeneratës së re të arkitekturës, i cili megjithatë ofron aftësi multimodale të integruara për të kuptuar imazhet dhe tejkalon modelet kryesore, përfshirë V4 Pro, në një sërë testesh të rëndësishme.

Arkitekturë e re asimetrike: kosto më të ulëta dhe inteligjencë e lartë

V4.1 Flash përdor një arkitekturë MoE me 552 miliardë parametra dhe një strukturë krejtësisht të re Causal-Encoder-Decoder. Veçoria kryesore është asimetria mes hyrjes dhe daljes: gjatë përpunimit të të dhënave hyrëse aktivizohen vetëm 8 miliardë parametra, ndërsa gjatë gjenerimit të përgjigjes aktivizohen 16 miliardë. Kjo e bën modelin dukshëm më ekonomik se modelet me përmasa të ngjashme.

Modeli përbëhet nga 40 shtresa Transformer: 20 të parat janë enkoder kauzal, ndërsa 20 të fundit janë dekoder. KV-cache global i dekoderit projektohet drejtpërdrejt nga shtresa e fundit e enkoderit, duke ulur ndjeshëm ngarkesën llogaritëse gjatë fazës prefill.

Cache-i kompresohet në maksimum, ndërsa kostoja ulet ndjeshëm

Gjenerata e re ka arritur një përmirësim të rëndësishëm në efikasitetin e KV-cache: krahasuar me V4 Flash të mëparshëm, nevoja për HBM është ulur 4 herë, ndërsa për SSD — 8 herë. Sipas zhvilluesit, krahasuar me gjeneratën e parë V1, vëllimi i KV-cache është zvogëluar 437 herë.

Kjo është veçanërisht e rëndësishme për skenarët agentikë, ku kostot e aksesimit të cache-it përbëjnë një pjesë të konsiderueshme të shpenzimeve dhe kompresimi i tij ul drejtpërdrejt koston e përdorimit.

Performanca tejkalon modelin kryesor

Në testet benchmark, V4.1 Flash e tejkaloi V4 Pro për nga niveli i inteligjencës. Në testin Terminal-Bench 2.1, modeli i ri shënoi 90.6 pikë, kundrejt 87.9 të V4 Pro dhe 82.7 të V4-Flash të mëparshëm. Në Terminal-Bench 3.0, më kompleks, diferenca u bë edhe më e madhe: 30.0 kundrejt 11.8 dhe 7.6 respektivisht.

DeepSWE v1.1 për zhvillimin e softuerit, rezultati ishte 74.2 kundrejt 62.7 të V4 Pro. Në renditjen e Codeforces, modeli arriti 3471 pikë, duke kaluar V4 Pro me 3348 pikë. Në fushën e sigurisë kibernetike, në CyberGym, rezultati ishte 88.1 kundrejt 83.3.

Kështu, në punën me terminalin, gjenerimin e kodit dhe sigurinë kibernetike — skenarë kryesorë për agjentët — V4.1 Flash tejkalon ndjeshëm modelet e mëparshme.

API dhe çmimet

V4.1 Flash është tashmë i disponueshëm në API-në e DeepSeek: mjafton të specifikohet emri i modelit deepseek-flash. Edhe çmimet janë ulur: gjatë orëve jashtë pikut, hyrja me cache hit kushton rreth 0,0026 euro, ndërsa cache miss rreth 0,13 euro; dalja kushton rreth 0,51 euro. Gjatë orëve të pikut, çmimi është dyfish më i lartë, ndërsa jashtë pikut është dyfish më i ulët.

Modelet e vjetra V4 Flash dhe V4 Flash Vision Exp janë çaktivizuar, por për arsye përputhshmërie, emrat e vjetër të modeleve ridrejtohen përkohësisht te V4.1 Flash.

Çfarë po ndodh me V4 Pro

Sipas të dhënave të fundit, në përgjigje të kërkesave të përdoruesve, DeepSeek ka vendosur të vazhdojë të ofrojë API-në V4 Pro edhe pas 14 shtatorit, ndërsa tarifimi mbetet i pandryshuar. Më parë ishte planifikuar që kërkesat për V4 Pro të ridrejtoheshin automatikisht te V4.1 Flash.

Për lexuesit që ndjekin zhvillimet në ndërtim dhe printimin 3D, veçanërisht interesante është aftësia multimodale e integruar e V4.1 Flash: modeli mund të njohë drejtpërdrejt vizatimet teknike të ndërtimit, fotografitë e pajisjeve ose imazhet nga procesi i punimeve, duke hapur mundësi të reja për përpunimin e dokumentacionit teknik.

Burimi: deepseek.com

Share:  

Comments