Kanusho Linasema Angalia Majibu. Hakuna Bidhaa Inayokupa Zana za Kufanya Hivyo.
Chapisho lililosambazwa sana linahoji kwamba kila chombo kikuu cha AI kinakiri kufanya makosa, kisha hakitoi kiolesura chochote cha kuyabaini. Suluhisho linalopendekezwa ni kwa kiasi kikubwa mabadiliko ya UI (kiolesura cha mtumiaji).
Kanusho tatu, kipengele kimoja kinachokosekana
Gemini inasema "AI can make mistakes, so double-check responses" (AI inaweza kufanya makosa, kwa hiyo hakiki majibu mara mbili). Claude inasema "Claude is AI and can make mistakes. Please double-check responses." (Claude ni AI na inaweza kufanya makosa. Tafadhali hakiki majibu mara mbili.) ChatGPT inasema "ChatGPT can make mistakes. Check important info." (ChatGPT inaweza kufanya makosa. Angalia taarifa muhimu.) Zote tatu zimeandikwa kwa herufi ndogo za kijivu, chini ya kisanduku.
Katika chapisho lililochapishwa tarehe 27 Septemba 2026, msanidi programu anayeandika kwa jina la Glyph anachukua sentensi hizo kama zilivyo na kuuliza swali la dhahiri linalofuata: kama kuhakiki majibu ni sehemu ya lazima ya mtiririko wa kazi, kiolesura cha kufanya hivyo kiko wapi? Jibu lake ni kwamba hakipo, na kwamba kanusho hizo hufanya kazi kama uhamishaji wa dhima ya kisheria badala ya muundo wa bidhaa. Hitimisho lake ni la wazi kabisa: chombo kinachokuambia uhakiki kazi yake huku hakikupi njia yoyote ya kufuatilia uhakiki huo, kwa mtazamo wake, kiko karibu zaidi na ulaghai kuliko bidhaa. Anapanua ukosoaji huo huo kwa Ollama, kiendeshaji cha miundo ya ndani (local models), akihoji kwamba kinahitaji vipengele hivi kuliko maabara kubwa kwa sababu miundo inayoendesha ni dhaifu zaidi.
Kiolesura kinachopendekezwa kinaonekanaje hasa
Maelezo mahususi yana uzito zaidi kuliko mabishano, kwa sababu mengi yake ni mabadiliko ya kiolesura cha mtumiaji badala ya mabadiliko ya muundo wa AI (model).
Kwa mazungumzo ya chat, anapendekeza karatasi ya kazi yenye safu mbili: majibu ya model upande wa kushoto, na sehemu ya maelezo ya binadamu upande wa kulia inayorekodi kazi iliyofanywa kuhakiki kila madai, pamoja na kisanduku cha kuteua unachokiteua tu pale unapoamini umehakiki. Kwa wasaidizi wa uandishi wa msimbo (coding assistants), anahoji kwamba kukosekana kwa hili kunasukuma uhakiki kwenye mapitio ya msimbo (code review), jambo linalomruhusu mwandishi rasmi kuwasilisha pull request ambayo hakuwahi kuisoma.
Kwa utafiti, mabadiliko anayopendekeza ni makali zaidi. Leo, marejeo (citations) huonekana kama vidokezo vidogo ndani ya maandishi vinavyoonyesha jina la kikoa na ikoni ya chini ya pikseli 16. Anataka rejeo liwe kitu cha msingi: tarehe ya uchapishaji, jina la mwandishi pale linapopatikana, na nukuu halisi isiyobadilishwa yoyote, iliyotolewa na programu ya kawaida, si na model, ikionyeshwa kubwa kuliko chochote kilichoandikwa na AI. Muhtasari uliozalishwa unashushwa hadi kwenye maandishi madogo ya kijivu yanayokaliwa sasa na kanusho.
Inafaa kufafanua istilahi hapa. RAG, au retrieval-augmented generation (uzalishaji unaosaidiwa na urejeshaji wa taarifa), ni mbinu ya kawaida ambapo mfumo hutafuta nyaraka kwanza kisha kulisha matokeo kwa model kama muktadha. Grounding (kuweka majibu kwenye vyanzo) ni neno la wauzaji linalomaanisha kuunganisha majibu na vyanzo hivyo vilivyopatikana. Glyph anakubali kwamba viungo hivyo vidogo vya marejeo vinaelekeza kwenye miundo halisi katika mfumo, si tokeni zilizobuniwa kwa udanganyifu (hallucinated). Hoja yake ni kwamba model bado inaweza kupotosha maandishi yaliyopatikana kama inavyopotosha kitu kingine chochote, kwa hiyo uwasilishaji haupaswi kamwe kuonekana wenye mamlaka.
Linalohusiana: provenance (asili ya data). Chatbot (programu ya mazungumzo ya AI) inapokuonyesha jedwali la data, baadhi yake ilitoka kimakanika kwenye API au simu ya zana, na baadhi ni matokeo ya model. Zote mbili huonyeshwa kwa namna ileile. Anataka zitenganishwe kwa mwonekano, pamoja na hatua ambapo namba zinachukuliwa kama lahajedwali na kuthibitishwa kwa hesabu za kawaida, huku hesabu zikionyeshwa.
Kipya kweli dhidi ya kinachojulikana tayari
Kidogo sana cha haya kinahitaji mafanikio makubwa katika model, na hiyo ndiyo nguvu ya hoja. Kadi za marejeo, visanduku vya kuteua, mitindo ya kuonyesha asili ya data na uthibitishaji wa hesabu ni kazi ya harness, yaani programu inayozunguka model, na vinaweza kutolewa kwa kutumia model za leo bila kuzibadilisha.
Mapendekezo mawili yanahitaji ushirikiano wa maabara. Kupiga marufuku lugha ya nafsi ya kwanza na maombi ya msamaha kwenye majibu ni mabadiliko ya tabia ya model; anahoji kwamba madai ya maabara hizo kwenye benchmark (vipimo vya ulinganishi) yenyewe yanathibitisha kwamba zinaweza kudhibiti matokeo kwa ukaribu. Na kuonyesha temperature (kiwango cha kubahatisha kinachoamua jinsi jibu linavyotofautiana kati ya majaribio) analilitaja lakini mara moja analitolea tahadhari, akibainisha kwamba kuiweka kuwa sifuri hakuleti matokeo ya kuaminika kwa urahisi hivyo. Sehemu ya uwezo wa kurudia matokeo (reproducibility) ndiyo iliyoendelezwa kwa kiwango cha chini zaidi katika chapisho.
Ukosoaji wa MCP unapingana na mwelekeo wa sasa wa sekta. Model Context Protocol huruhusu chatbot kuita zana za nje na kuchukua hatua. Pingamizi la Glyph ni hili: kama ingizo la lugha ya kawaida halina usahihi wa kutosha hadi linahitaji ufafanuzi wa mara kwa mara, kuupa mfumo huohuo uwezo wa kuharibu ni kinyume cha mantiki. Angependelea kuona vitufe vya kazi mahususi, kwa mfano kidhibiti maalum cha kuchanganua msimbo (codebase) kutafuta udhaifu wa OWASP Top 10, vikiungwa mkono na model ndogo zilizofunzwa kwa kusudi hilo.
Maswali Unayopaswa Kujiuliza
- Kama wafanyakazi wetu wanatakiwa kuhakiki majibu ya AI, ni wapi katika zana zetu uhakiki huo unarekodiwa, na je, tunaweza kutoa kumbukumbu hiyo endapo madai tuliyoyawasilisha yatageuka kuwa makosa?
- Muulize muuzaji wako moja kwa moja: ni asilimia ngapi ya marejeo yanayoonyeshwa kwenye kiolesura chenu yanaunganisha na maandishi ambayo mtumiaji anaweza kuyasoma bila mabadiliko, ikilinganishwa na muhtasari ulioandikwa na model?
- Ni pull request ngapi zilizounganishwa (merged) kwenye mradi wetu ziliandikwa na msaidizi wa AI kisha kupitiwa na mtu aliyedhani mwandishi tayari amehakiki?
- Jedwali linapotokea kwenye jibu la chat, je, kuna mtu yeyote kwenye timu anayeweza kutofautisha seli zipi zilitoka kwenye simu ya API na zipi zilitoka kwa model?
- Je, tunanunua ufikiaji wa zana za kiwakala (agentic) kwa sababu unatatua tatizo tulilonalo, au kwa sababu ndicho wauzaji wanachouza sasa hivi?
Cha Kufuatilia Baadaye
Ishara ni mahali kanusho linapokaa. Kama muuzaji yeyote mkuu atahamisha uhakiki kutoka kwenye lugha ya kisheria ya kijivu hadi kwenye kipengele cha kiolesura kinachofanya kazi, yaani kisanduku cha kuteua, kadi ya rejeo au alama ya asili ya data, hiyo ina maana anakubali jukumu la muundo kwa kiwango cha makosa badala ya kulikabidhi kwa mtumiaji. Kila kitu kingine katika mjadala huu kinafuata uamuzi huo mmoja.
- 1Weka kumbukumbu tofauti ya uhakiki: bandika kila madai ya AI pamoja na kiungo cha chanzo chake na alama ya imehakikiwa/haijahakikiwa, kwa kuwa hakuna chatbot inayofuatilia hili kwa niaba yako.
- 2Iombe model iorodheshe kila madai ya kweli (factual claim) iliyotoa kama orodha ya ukaguzi yenye namba, kisha yahakiki moja baada ya jingine kwa kutumia vyanzo vya msingi.
- 3Chukulia kila matokeo ya AI ambayo hujayatafutia chanzo mwenyewe kama rasimu ya dhana tu, na usiyatume kwa wenzako au wateja bila kuyaweka alama.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
