Injini ya Chanzo-Huria Inajirekebisha kwa Chip Yako, Ikidai Kasi Zaidi ya Asilimia 92
Magnitude inasema inakusanya kernels kwenye vifaa vyako vyenyewe ili kuendesha miundo huria hadi mara 2 kwa kasi kuliko llama.cpp. Hivi ndivyo unavyoweza kujaribu dai hilo kabla ya kulitegemea.
Magnitude, kampuni ya Y Combinator S25, imetoa injini ya inference (programu inayoendesha modeli ya AI iliyofunzwa na kutoa majibu) ya chanzo-huria, ambayo inasema inaendesha miundo ya open-weight (miundo ambayo uzito wake umetolewa wazi) hadi mara 2 kwa kasi kuliko llama.cpp. Takwimu za kampuni yenyewe: decode yenye kasi zaidi kwa asilimia 92 kwenye Metal ya Apple na asilimia 19 kwenye CUDA ya NVIDIA. Programu hii ina leseni ya Apache 2.0 na inapatikana kama programu ya desktop kwa macOS, Windows na Linux. Hayo ni majaribio ya kampuni yenyewe, si matokeo huru, na tofauti kati ya asilimia 92 na asilimia 19 ndilo jambo la kwanza ambalo mwendeshaji anapaswa kuliona.
'Kujirekebisha kwenye Kifaa Chako' Kunamaanisha Nini Hasa
Injini ya inference ni programu inayoendesha modeli iliyofunzwa na kugeuza prompt (maelekezo unayoiandikia AI) yako kuwa matokeo. Ndani yake, kazi nzito hufanywa na kernels: vipande vidogo vya programu vilivyobobea sana vinavyofanya hesabu kuu kwenye GPU au CPU. Kasi ya kernel inategemea maelezo ya chip husika, kama vile jinsi kumbukumbu yake ilivyopangwa na idadi ya hesabu inazoweza kufanya kwa wakati mmoja.
Hoja ya Magnitude ni kwamba zana maarufu kama llama.cpp, Ollama na LM Studio zinakuja na kernels zilizokusanywa tayari kwa makundi mapana ya vifaa. Hilo ni la kurahisisha, lakini kernel iliyotengenezwa kwa kundi la chips mara chache huwa bora zaidi kwa chip yako mahususi. Magnitude inasema badala yake inakusanya na kurekebisha kernels zake kwenye mashine yako halisi kabla modeli haijaanza kuendeshwa, ili zilingane na silicon yako hasa. Inasema pia inaandika kwa mkono kernels zilizoboreshwa kwa familia maarufu zaidi za miundo ya open-weight, jambo inalolitaja kuwa sababu ya kuzipita injini za matumizi ya jumla.
Kuna mabadilishano yanayostahili kueleweka. Kernels zilizokusanywa tayari huanza papo hapo na hufanya kazi kwa namna ile ile kila mahali. Mbinu ya kujirekebisha kwenye kifaa huongeza hatua ya maandalizi na hufanya utendaji kutegemea mashine inayotumika, ambayo ni sehemu ya sababu kwa nini faida za kampuni hutofautiana sana kati ya Metal na CUDA.
Madai Mengine Inayotoa
Kampuni inaorodhesha vipengele vingine kadhaa. Inasema agents (programu za AI zinazofanya kazi kwa kujitegemea) hutumia kumbukumbu chini kwa asilimia 27, na kumbukumbu huachiliwa agents wanaposimama. Inasema vikao vinavyoendeshwa kwa wakati mmoja hushiriki prefix caches, yaani injini hutumia tena kazi iliyokwisha kufanyika kwenye sehemu ya mwanzo ya prompt inayofanana, hivyo kuendesha agents kadhaa kwa pamoja hakupunguzi kasi ya kila kitu. Inaunganishwa kwa mbofyo mmoja na agents wakiwemo Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi na Cline, na kitu kingine chochote kinaweza kuunganishwa kupitia API (kiolesura cha kuunganisha programu) inayooana na OpenAI. Kila kitu kinaendeshwa ndani ya kifaa chako: prompts, mafaili na miundo hubaki kwenye mashine yako, na hakuna intaneti inayohitajika baada ya modeli kupakuliwa. Inasaidia Apple Silicon, NVIDIA, AMD, au CPU peke yake, bila kiwango cha chini kilichowekwa cha vifaa; mashine ndogo huendesha miundo midogo.
Mpango wa Busara wa Mwezi Mmoja
Chukulia hili kama mashindano ya majaribio, si uhamishaji. Chagua mashine moja ambayo timu yako huitumia kweli, sakinisha Magnitude sambamba na mfumo wako wa sasa, na uendeshe modeli ile ile kwa prompts zile zile kupitia zote mbili. Pima kile unachojali, iwe ni muda hadi token ya kwanza, kasi endelevu ya matokeo, au idadi ya vikao vya agents vinavyoweza kuendeshwa kabla mambo hayajapungua kasi. Kama vifaa vyako vingi ni vya NVIDIA, takwimu ya kampuni yenyewe ya CUDA ya asilimia 19 ndiyo ya kujaribu, si kichwa cha habari cha mara 2.
Kosa lingekuwa kuandika upya miundombinu kwa kutegemea benchmark ya muuzaji, au kudhani kasi kwenye chip moja inahamia kwenye nyingine. Vilevile, kulipuuza ni kosa: leseni ya Apache 2.0 na muundo wa kufanya kazi ndani ya kifaa pekee vinamaanisha kujaribu kuna hatari ndogo ya kufungwa kwa muuzaji mmoja au ya usalama wa data.
Maswali Unayopaswa Kuuliza
- Takwimu za asilimia 92 na asilimia 19 zilipimwa kwenye miundo gani, viwango gani vya quantization (kupunguza ukubwa wa modeli) na urefu gani wa prompt, na je, benchmark inalingana na jinsi agents wetu wanavyofanya kazi kweli?
- Hatua ya kujirekebisha kwenye kifaa huchukua muda gani, na nini hutokea kwa kasi mara ya kwanza modeli mpya au mashine mpya inapotumika?
- Kichwa cha habari cha 'hadi mara 2' kiko juu sana ya takwimu ya CUDA ya asilimia 19. Tuna vifaa gani, na ni takwimu ipi inayohusu vifaa hivyo?
- Ni miundo ipi kati ya inayosaidiwa ina kernels zilizoboreshwa kwa mkono, na modeli iliyo nje ya orodha hiyo ni polepole kwa kiasi gani?
- Je, mtu yeyote nje ya kampuni anaweza kurudia matokeo haya, na je, kuna aliyefanya hivyo?
Cha Kufuatilia Baadaye
Ishara ya kutafuta ni benchmarks huru zinazoweza kurudiwa kwenye vifaa vya NVIDIA na AMD, ambako takwimu ya kampuni yenyewe ni ndogo zaidi, pamoja na kasi ambayo orodha ya miundo inayosaidiwa inakua zaidi ya familia ambazo timu inazirekebisha kwa mkono. Kama majaribio ya watu wengine yatakaribia takwimu zinazodaiwa na orodha ya miundo ikaenda sambamba na matoleo mapya ya open-weight, kujirekebisha kwa kila kifaa kunakuwa mshindani makini wa injini zilizokusanywa tayari; kama faida zitapungua nje ya chips za Apple, itabaki faida ya kundi dogo tu.
- 1Jaribu injini ya inference ya Magnitude kwenye vifaa vyako mahususi kabla ya kubadili; faida za benchmark hutofautiana sana (asilimia 92 kwenye Metal ya Apple dhidi ya asilimia 19 kwenye NVIDIA).
- 2Tumia injini ya chanzo-huria yenye leseni ya Apache 2.0 kuboresha inference ya modeli ndani ya kifaa chako, ukiepuka gharama za cloud (huduma za kompyuta mtandaoni) kwa miundo ya open-weight inayooana.
- 3Linganisha benchmarks huru na madai ya kampuni, kwani utendaji hutegemea sana usanifu wako hasa wa GPU/CPU na uboreshaji wa kernel.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
