Red Hat ililinganisha Jev na classifiers za kizamani na haikuona faida yoyote
Red Hat ilipima guardrails tisa kwenye prompt injection na maudhui yenye sumu. Hii ndiyo jinsi decision models kama Jev zinavyofanya kazi, na mambo ya kuuliza kabla ya kuweka dau kwenye moja.
Tarehe 2 Oktoba 2026, wahandisi wa Red Hat Rob Geada, Mac Misiura na Shelton Cyril walichapisha benchmark (kipimo cha ulinganisho) ya mipangilio tisa ya AI guardrail (kizuizi cha usalama cha AI), iliyoundwa kupima kama "decision models" (miundo ya maamuzi) kama Jev ya TypeSafe AI kweli zinazishinda mbinu zinazotumika tayari. Kauli kuu ya mfumo wao ni wazi: wanahoji kama mbinu hii ni mpya kama inavyodaiwa, na wanapima kama dai la Jev kuwa na utendaji unaofanana na LLM-as-a-judge kwa gharama na ucheleweshaji mdogo zaidi linathibitika. Angalizo moja kabla ya maelezo: dondoo la makala tuliyopewa linakatika kabla ya jedwali za matokeo, kwa hiyo makala hii inahusu muundo wa jaribio na umuhimu wake, si alama zilizopatikana.
Decision model ni nini hasa
Guardrail ni kituo cha ukaguzi kinachoamua kama ujumbe wa mtumiaji unapaswa kuzuiwa, kwa mfano kwa sababu unajaribu kuteka AI (prompt injection, yaani kuingiza maagizo ya kuvuruga) au una maudhui yenye sumu. Kuna njia tatu za kujenga guardrail, na benchmark inazigusa zote.
Ya kwanza ni traditional classifier (kiainishaji cha kawaida): modeli ndogo iliyofundishwa kwa mifano iliyowekewa lebo kujibu swali moja. Ni ya haraka, nafuu na hurejesha jibu la aina isiyobadilika, lakini lazima mtu awe na data ya mafunzo.
Ya pili ni LLM-as-a-judge (LLM kama mwamuzi): unaipa large language model (modeli kubwa ya lugha) sera iliyoandikwa na kuiuliza kama ujumbe unakiuka. Ni rahisi kubadilika, lakini huzalisha maandishi tokeni kwa tokeni, hivyo hugharimu zaidi na huchelewa zaidi.
Ya tatu ni decision model. Unaipa hali (kipande cha maandishi) na orodha ya maswali, nayo hurejesha majibu ya muundo usiobadilika badala ya kuzalisha maelezo marefu. Katika mfano wa TypeSafe, sarafu inayoanguka upande wa kichwa kwa 60% ya nyakati hutoa uwezekano uliowekewa aina wa 0.58 kwa "kurusha kunakofuata kutakuwa kichwa." Kulingana na makala, faida zinazodaiwa ni schema na usalama wa aina (type safety) uliohakikishwa, gharama na ucheleweshaji mdogo kuliko LLM, na utendaji wa zero-shot, yaani inashughulikia matatizo mapya bila kufundishwa juu yake.
Nini ni kipya, na nini ni kilichofungashwa upya
Waandishi wa Red Hat wanasema decision models bila shaka zimekuwepo kwa miaka kama zero-shot text classifiers (viainishaji vya maandishi bila mafunzo mahususi), wakitaja BART-large-mnli ya Meta ya mwaka 2019. Pia wanamtaja Nandakishor Mukkunoth, muundaji wa Laya, ambaye katika makala ya Septemba 2026 alipendekeza kuwa teknolojia ya msingi huenda isiwe mpya hivyo. Ushahidi wanaotoa: mbadala za open-source zilijitokeza haraka, zikiwemo Laya (iliyojengwa juu ya ModernBert) na matumizi ya majaribio ya vLLM ya DiffusionGemma kutoa maamuzi ya mtindo wa Jev.
Kinachoweza kuwa kipya ni ufungashaji: kiolesura chenye aina na schema iliyohakikishwa juu ya uamuzi wa zero-shot. Kama usahihi wa msingi ni mpya ndilo swali ambalo benchmark inalichunguza.
Jinsi jaribio lilivyojengwa
Timu ilijenga guardrail ya prompt-injection na guardrail ya usalama wa maudhui kwa kila mbinu, ikihusisha mbinu nne: classifiers zilizofundishwa awali za ukubwa wa CPU (chini ya vigezo milioni 200, zikiwemo DeBERTa na Granite Guardian za Red Hat yenyewe), BART-large-mnli, LLM judges (Shieldstral, Nemotron-3.5, Qwen3.6-35B), na decision models (Laya, DiffusionGemma, Jev-1.13.0). Walizipitisha kupitia NeMo Guardrails wakitumia benchmarks za prompt-injection na toxicity za EvalHub, na seti za data zenye madarasa yaliyosawazishwa ili usahihi uwe kipimo cha haki, na walipima latency ya safari ya kwenda na kurudi.
Maelezo mawili ni muhimu. Mbinu za mbali, ikiwemo API ya Jev, zina latency ya mtandao ambayo modeli za CPU za ndani hazina. Na waandishi wanabainisha kuwa fasili za hatari zilibadilishwa kutoka kwenye prompts za LLM-judge, hivyo modeli za zero-shot zinaweza kufanya vizuri zaidi na sera zilizoandikwa kwa ajili yake. Pia zingatia ufichuzi huu: huu ni upimaji wa Red Hat, na timu yake ya AI Safety imekuwa ikitetea kwa muda mrefu modeli ndogo za kutabiri kwa guardrails.
Maswali Unayopaswa Kuuliza
- Kama muuzaji anadai usahihi wa kiwango cha LLM kwa gharama ndogo, je, kipimo hicho kilifanywa dhidi ya classifier ndogo iliyofundishwa pia, au dhidi ya LLM judge pekee?
- Je, kielelezo cha latency kinajumuisha safari za mtandao kwenda API iliyohifadhiwa kwa mtoa huduma, na trafiki yako inaweza kuvumilia utegemezi huo?
- Je, una data iliyowekewa lebo kwa hatari yako? Kama unayo, faida ya zero-shot huenda isikuhusu.
- Matokeo ya decision model yanategemea kiasi gani jinsi swali la sera lilivyoandikwa, na nani anatunza maneno hayo?
- Nani aliendesha benchmark, kwa prompts zipi, na je, waandishi walikuwa na maslahi kwenye matokeo?
Nini cha Kufuatilia Baadaye
Fuatilia majaribio huru ya kurudia upimaji yakiwa na sera zilizoandikwa mahususi kwa decision models, na jibu la TypeSafe kwa benchmark hii. Kama sera za zero-shot zilizoboreshwa zitapunguza pengo na classifiers zilizofundishwa, hoja ya kiolesura chenye aina itaimarika; kama sivyo, decision models zitaonekana kuwa ufungashaji upya wa uainishaji wa zero-shot.
- 1Kabla ya kutumia suluhisho mpya za AI guardrail, fanya benchmarks za kulinganisha dhidi ya classifiers ulizonazo ili kuthibitisha maboresho ya utendaji yanayodaiwa.
- 2Tathmini vipimo vya gharama na latency wakati wa kulinganisha decision models, kwani gharama ndogo pekee haihakikishi suluhisho liko tayari kwa matumizi halisi.
- 3Buni majaribio ya guardrail yanayojumuisha mbinu za kawaida za msingi pamoja na mbinu mpya ili kubaini ubunifu wa kweli dhidi ya madai ya kibiashara.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
