Modeli yenye vigezo bilioni 284 sasa inaendeshwa kwenye Mac ya GB 128. Nani anapoteza?
ds4, injini huria ya C, inabana DeepSeek V4 Flash kwenye Mac zenye kumbukumbu kubwa na kompyuta za NVIDIA na AMD, ikiwa na API ya ndani ambayo Claude Code na Codex CLI vinaweza kuelekezwa kwake.
DwarfStar 4, au ds4, ni injini ya inference (utekelezaji wa modeli ya AI ili itoe majibu) yenye leseni ya MIT, iliyoandikwa kwa lugha ya C, inayoendesha DeepSeek V4 na V4.1 Flash, GLM 5.x na Qwen3.8 Flash Next kwenye kompyuta za Mac, CUDA na ROCm zenye kumbukumbu kubwa. Jedwali la benchmark (vipimo vya kasi) la mradi wenyewe linaonyesha M5 Max yenye kumbukumbu ya GB 128 ikizalisha tokens 39.4 kwa sekunde kwenye muktadha wa tokens 2,048, na 27.6 kwenye tokens 65,536. Hizo ni namba za mradi wenyewe, si vipimo huru, lakini zinaeleza modeli yenye vigezo bilioni 284 ikijibu kwa kasi ya mazungumzo kwenye kompyuta moja ya kazi.
Jinsi modeli yenye vigezo bilioni 284 inavyotosha kwenye mashine moja
DeepSeek V4 Flash ni modeli ya mixture-of-experts (mchanganyiko wa wataalamu). Badala ya kuendesha kila kigezo kwa kila neno, ina mitandao midogo mingi maalum, inayoitwa experts (wataalamu), na router (kipanga njia) huchagua wachache kwa kila token. Uzito mwingi wa modeli upo kwenye routed experts hao, jambo linaloifanya sehemu hiyo kuwa dhahiri kwa kuokoa kumbukumbu.
ds4 hutumia kile inachokiita asymmetric 2-bit quantization. Quantization ni kuhifadhi kila namba kwa biti chache, ili kupata faili dogo zaidi kwa gharama ya usahihi kidogo. Kutolingana huko ndiko msingi wake: routed experts hubanwa kwa nguvu, huku njia za pamoja ambazo kila token hupitia zikibaki sahihi. Mradi unaeleza hili kama kubana bila kuharibu uwezo wa modeli. Kama hilo ni kweli kwa kazi zako, chanzo hakionyeshi, kwa kuwa kinachapisha takwimu za kasi lakini hakina ulinganisho wa ubora.
Chaguo zingine mbili za muundo ni muhimu. La kwanza ni kwamba ds4 huhifadhi KV cache kwenye diski. KV cache ni kumbukumbu ya kazi ya modeli kuhusu prompt (maelekezo unayoiandikia modeli) yako hadi sasa, na kuijenga upya baada ya kuwasha upya (re-prefill) ni polepole kwenye miktadha mirefu. ds4 huhifadhi viambishi virefu kwenye SSD na kuendelea kwa kutumia hash ya prompt. La pili ni kwamba injini ileile hutumikia CLI ya mazungumzo, seva ya HTTP ya ndani na wakala wa uandishi wa programu unaodumu, vyote vikishiriki hali moja ya modeli na cache moja.
Nani anafaidika, na nani yuko hatarini
Seva hufichua /v1/chat/completions, /v1/messages na /v1/responses, na mradi unataja OpenCode, Claude Code, Codex CLI na Pi kama wateja wake. Kivitendo, timu inaweza kuelekeza zana zake za uandishi wa programu zilizopo kwenye mashine iliyo chini ya meza badala ya kituo cha cloud kinachopimwa kwa matumizi. Wanaofaidika ni timu zenye msimbo au nyaraka ambazo haziwezi kuzituma kwa mtu wa tatu, na yeyote ambaye bili yake ya tokens hupanda kadiri matumizi ya mawakala yanavyoongezeka.
Aliye hatarini ni yeyote ambaye biashara yake ni kuuza upatikanaji wa modeli hizi zenye uzito huria. Chanzo hakijadili bei, kwa hiyo haijulikani ni kiasi gani cha pesa kinahama. Lakini kiwango cha vifaa kimetajwa waziwazi: V4 Flash Q2 ndiyo msingi kwa mashine za GB 128, GLM 5.3 Q2 na Qwen Q4 pia zinatosha kwa ukubwa huo, V4.1 Q2 hutiririka kutoka SSD, na ukurasa unaonyesha Qwen inaweza kufanya kazi kwenye GB 64.
Pia kuna hatari ya kimya upande wa mnunuzi. Kuhamisha inference ndani ya kampuni kunahamisha pia mzigo wa uendeshaji: kuweka viraka vya usalama, uwezo wa mfumo, na swali la nani atakuwa zamu injini ikileta hitilafu. Chanzo kinaeleza ds4 kama injini nyembamba yenye lengo maalum, jambo lenye pande mbili.
Benchmarks zinasema nini na hazisemi nini
Namba hutofautiana kulingana na vifaa. DGX Spark, nayo ikiwa na GB 128, inaonyesha prefill ya tokens 825.8 kwa sekunde kwenye tokens 2,048 lakini inazalisha 18.1 tu, ikilinganishwa na 39.4 ya M5 Max. Prefill ni kusoma prompt yako; generation ni kuandika jibu. Kwa nyaraka ndefu na vipindi vya mawakala, kasi ya prefill na matumizi tena ya cache ni muhimu sawa na kasi ya jumla ya generation. Ukurasa pia unaita takwimu zake makadirio yaliyotokana na jedwali la benchmark la mradi.
Maswali Unayopaswa Kujiuliza
- Je, 2-bit quantization ya routed experts inagharimu kiasi gani katika ubora wa majibu kwenye kazi zetu, na ushahidi uko wapi zaidi ya majedwali ya kasi?
- Tukihamishia trafiki ya mawakala ndani ya kampuni, nani anamiliki upatikanaji wa huduma, masasisho na marekebisho ya usalama ya injini changa ya C yenye wigo mdogo?
- Kwa takriban tokens 28 kwa sekunde na muktadha wa tokens 65,536, je, wakala wa uandishi wa programu wa hatua nyingi ni wa haraka vya kutosha kwamba wahandisi wataitumia kweli?
- Ni sehemu gani ya matumizi yetu ya sasa ya cloud ni upatikanaji wa modeli kweli, na ni sehemu gani ni huduma inayoizunguka ambayo tungelazimika kuijenga upya?
- Je, leseni za uzito wa modeli, si tu leseni ya MIT ya ds4, zinaruhusu jinsi tunavyopanga kuzitumia?
Cha Kufuatilia Baadaye
Ishara ni upimaji huru wa ubora wa matoleo ya Q2 dhidi ya modeli za usahihi kamili, ukifanywa kwenye kazi halisi za uandishi wa programu na miktadha mirefu, si majedwali ya kasi ya mradi wenyewe. Matokeo hayo yakithibitika, swali litahama kutoka kama inference ya kisasa ya ndani inafanya kazi hadi ni kazi zipi zinapaswa kuondoka cloud kwanza.
- 1Sakinisha DeepSeek V4 Flash kwa kutumia DwarfStar 4 kwenye Mac yako ili kuendesha modeli za bilioni 284 ndani ya kompyuta bila gharama za cloud.
- 2Jaribu mabadilishano ya urefu wa muktadha: tarajia tokens 39.4 kwa sekunde kwenye muktadha wa 2K dhidi ya 27.6 kwenye 65K kwenye M5 Max GB 128.
- 3Tumia usanifu wa mixture-of-experts kuendesha modeli kubwa kwenye vifaa vya kawaida kwa kutumia tu wataalamu wanaowashwa.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
