Kipimo hiki cha LLM kwenye kivinjari kinapima GPU yako kama vile kinavyopima modeli
MicroLLM Lab huendesha modeli ndogo zilizobanwa (quantized) ndani ya kifaa chako bila seva, kisha inakupa cheti unachoweza kushiriki. Swali gumu zaidi ni kile kinachopimwa hasa.
Kipimo kinachokuambia mapema kwamba modeli zake zitashindwa
MicroLLM Lab, jaribio lililowekwa kwenye Hacker News, hupakia modeli ndogo za lugha zilizobanwa (quantized) moja kwa moja kwenye kichupo cha kivinjari na kuziendeshea mfululizo wa majaribio. Sentensi ya uwazi zaidi kwenye kiolesura chote iko kwenye maelezo yake yenyewe: ukaguzi huo ni "objective checks (regex / exact tokens), not writing quality" (ukaguzi wa kiukweli unaotumia regex na tokeni kamili, si ubora wa uandishi), na "a 135M model is allowed to fail — that is the measurement" (modeli ya 135M inaruhusiwa kushindwa, na huo ndio kipimo chenyewe).
Msimamo huu ni adimu kuliko unavyosikika. Maonyesho mengi ya modeli hutengenezwa ili modeli ionekane yenye uwezo. Hili limetengenezwa kugundua kama modeli ndogo sana inaweza kufikia lengo kamili, na kupima kasi yake inapokosea.
Kinachotokea hasa ndani ya kichupo
Ukurasa unajieleza kuwa unaanzisha WebGPU engine na orodha ya modeli. WebGPU ni kiolesura cha kivinjari kinachoruhusu ukurasa wa wavuti kutumia vifaa vyako vya michoro kwa hesabu za jumla, na ndicho kinachowezesha uendeshaji wa modeli ndani ya kifaa bila programu maalum. Modeli zimeelezwa kuwa Q4, yaani ubanaji wa biti nne (four-bit quantization), ambapo uzito wa modeli (weights) umepunguzwa kutoka namba za usahihi wa juu hadi biti nne kila moja. Hii hupunguza ukubwa wa modeli kiasi cha kuweza kupakuliwa na kuhifadhiwa kwenye kumbukumbu ya kompyuta za kawaida, kwa gharama ya kupungua kidogo kwa ubora wa matokeo.
Baada ya kupakiwa, uzito huhifadhiwa kwenye IndexedDB, hifadhidata ya ndani ya kivinjari, ili ukitembelea tena usilazimike kupakua kila kitu upya. Kuna vitufe vya kupakia modeli zote, kuziondoa zote, na kuchagua modeli inayotumika, pamoja na kikomo cha tokeni kwa kila uzalishaji.
Upande wa upimaji hugawanya kasi katika namba mbili ambazo watu mara nyingi huzichanganya. Peak speed (kasi ya kilele) ni kasi ya jaribio moja lililo la haraka zaidi. Sustained speed (kasi endelevu) hutokana na utoaji endelevu wa tokeni 256, yaani mwendo mrefu zaidi ambapo upunguzwaji wa kasi kwa sababu ya joto (thermal throttling), msongamano wa kumbukumbu na kompyuta yenye shughuli nyingi huanza kuonekana. Pia kuna wastani wa kasi endelevu kwa modeli zote zilizojaribiwa na jumla ya muda wa mfululizo mzima wa majaribio, vikionyeshwa kwenye chati za muda kwa kila jaribio na usahihi kwa kila jaribio. Ukurasa unasema wazi kwamba yote haya yanatokana na majaribio yaliyoendeshwa kwenye kivinjari chako na kwamba "numbers stay on this machine" (namba hubaki kwenye kifaa hiki).
Mahali dai na kilichotolewa vinapotofautiana
Kilichothibitishwa: kinafanya kazi, ndani ya kifaa chako, na kinaripoti vipimo halisi vya muda kutoka kwenye kifaa chako. Si picha ya kuigiza tu, na dai la faragha linafuata moja kwa moja kutokana na muundo wake: kama hakuna kinachotoka nje ya kichupo, basi hakuna kinachotoka.
Kinachobaki kuwa onyesho tu (demo), yaani kinapendekeza lakini hakihitimishi:
- Kila namba ya kasi ni kipimo cha pamoja cha modeli na kifaa chako, kivinjari, madereva na chochote kingine kinachoendeshwa. Watu wawili wanaolinganisha alama zao wanalinganisha kompyuta zao kama vile modeli.
- Ukurasa unatoa "Verified Benchmark Certificate" (Cheti cha Kipimo Kilichothibitishwa) chenye jina lako la mtumiaji, taarifa za kifaa, tokeni kwa sekunde za kilele na za kudumu, kinachoweza kupakuliwa kama PNG na kushirikiwa kwenye X na LinkedIn. Hakuna chochote kwenye chanzo kinachoeleza ni nini kinachothibitisha. Picha iliyozalishwa na mtumiaji mwenyewe ya jaribio alilojiripotia ni picha ya skrini yenye herufi nzuri zaidi.
- Usahihi ni asilimia ya majaribio yaliyofaulu kwenye ukaguzi wa regex na tokeni kamili. Hiyo hupima kufuata muundo na usahihi finyu, si hoja wala manufaa. Zana inasema hivyo; cheti hakibebi tahadhari hiyo.
- Kuna kihariri cha kipimo maalum, na chanzo kinasema kwamba kihariri hicho "is eval()'d in this origin" (kinaendeshwa kwa eval() ndani ya asili hii). Kwa lugha rahisi, msimbo unaobandika huendeshwa kama JavaScript inayoaminika ndani ya ukurasa. Hakuna tatizo kwa vipande vyako mwenyewe. Lakini si salama kwa kipimo alichokutumia mgeni.
Maswali Unayopaswa Kujiuliza
- Kama vifaa viwili vinatoa tokeni kwa sekunde tofauti kwa modeli ile ile, "alama" inayoshirikiwa inamthibitishia nini mtu anayeisoma?
- Ni nini kinachofanya cheti kiwe "kilichothibitishwa"? Je, kuna ukaguzi wowote zaidi ya kivinjari kuripoti namba zake chenyewe?
- Je, asilimia ya regex iliyofaulu inatabiri chochote kuhusu jinsi modeli ndogo itakavyofanya kazi kwenye mzigo wako halisi wa kazi, ambapo jibu sahihi si maandishi yaliyopangwa kabla?
- Kabla ya kubandika kipimo cha mtu mwingine kwenye kihariri kinachotumia eval() ndani ya asili ya ukurasa, ni nini kingine kilicho ndani ya asili hiyo?
- Kama ubanaji wa Q4 ndio sababu modeli hizi zinatosha kwenye kichupo, usahihi uligharimu kiasi gani, ukilinganishwa na modeli ya msingi isiyobanwa?
Cha Kufuatilia Baadaye
Ishara muhimu ni kama mradi utachapisha orodha ya modeli na ufafanuzi wa majaribio kwa namna ambayo kila mtu anaweza kuyaendesha upya na kulinganisha, pamoja na urekebishaji (normalization) wa tofauti za vifaa. Bila hilo, vyeti vitasambaa kama majigambo ya vifaa tu. Kwa hilo, hii inakuwa njia nafuu na ya uaminifu ya kujua ni modeli gani ndogo inayofikia kiwango chako kwenye kompyuta yako mwenyewe, ambacho ndicho kipimo pekee kilichowahi kuwa muhimu kwa uendeshaji wa modeli ndani ya kifaa.
- 1Ripoti GPU yako, kivinjari na VRAM pamoja na alama yoyote ya LLM ya ndani ya kivinjari, kwa sababu kasi ya WebGPU hutofautiana zaidi kuliko modeli yenyewe.
- 2Tumia ukaguzi wa regex au tokeni kamili kupima modeli ndogo, na uchukulie kushindwa kwa modeli ya 135M kama data halali, si jaribio lililoharibika.
- 3Pasha moto modeli kwa prompt (maelekezo unayompa AI) ya kujaribu tu kabla ya kupima muda, ili uandaaji wa shader na upakiaji wa uzito usiongeze ucheleweshaji wa tokeni ya kwanza.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
