Claude Opus 5.5 Yaondoa Kitufe cha Kuzima Thinking
Mwongozo mpya wa prompting wa Anthropic unathibitisha kuwa Opus 5.5 inakataa thinking: disabled. Effort sasa ndiyo kidhibiti pekee, na chaguo-msingi limeshushwa kutoka high hadi medium.
Mpangilio ambao haupo tena
Ndani ya mwongozo wa prompting wa Anthropic kuhusu Claude Opus 5.5 kuna mabadiliko yanayovunja msimbo unaofanya kazi badala ya kuuboresha tu: modeli haikubali thinking: {"type": "disabled"}. Claude Opus 5 iliruhusu hili kwenye effort ya kiwango cha high au chini yake. Opus 5.5 haiiruhusu. Thinking (kufikiri kwa modeli kabla ya kujibu) huwa imewashwa kila wakati, na kidhibiti pekee kilichobaki cha kiasi cha kufikiri kinachofanyika ni kiwango cha effort (juhudi ya kufikiri).
Kwa timu nyingi, namba kuu ni za kufurahisha zaidi. Anthropic inasema Opus 5.5 inatoa output tokens (vipande vya maandishi vya jibu) kwa kasi zaidi ya asilimia 30 kuliko Opus 5, na huwa inamaliza kazi ile ile ikitumia tokens chache zaidi. Kampuni pia inasema prompts zilizopo za Opus 5 zinapaswa kufanya kazi bila mabadiliko. Tatizo liko kwenye mipangilio inayozunguka prompt, si kwenye prompt yenyewe.
Kwa nini "medium" si medium ile ile
Effort ni kidhibiti kinachoamua modeli ifikiri kwa muda gani kabla ya kujibu. Opus 5.5 ina chaguo-msingi la medium; Opus 5 ilikuwa na chaguo-msingi la high. Majina ya viwango hayahamishiki kutoka modeli moja hadi nyingine. Kwa mujibu wa majaribio ya Anthropic yenyewe, Opus 5.5 kwenye medium inalingana au kuzidi Opus 5 kwenye high katika tathmini za uandishi wa programu na kazi za maarifa, na katika tathmini kadhaa za uandishi wa programu low inakaribia kwa gharama ndogo zaidi. Hiyo ni benchmark ya muuzaji, si ya kujitegemea, na ushauri wa mwongozo ni kujaribu viwango mbalimbali kwenye tathmini zako mwenyewe badala ya kubeba thamani uliyotumia awali.
Ukinakili mpangilio wa zamani moja kwa moja, bili inaelekea upande mbaya. Kwa kiwango chochote, mwongozo unasema, Opus 5.5 inafikiri zaidi kwa kila zamu kuliko Opus 5, hasa kwenye xhigh na max. Thinking tokens huhesabiwa ndani ya max_tokens hata kama maudhui ya kufikiri hayarudishwi kwako, kwa hiyo kikomo kilichopangwa kwa Opus 5 ikiwa thinking imezimwa kinaweza kukata majibu. Anthropic inapendekeza 128,000, kiwango cha juu cha modeli, kwa zamu ndefu zinazotokana na uandishi wa programu wa kiwakala (agentic), na inasema kupunguza kiwango cha effort hupunguza thinking kwa uhakika zaidi kuliko maagizo yanayoiambia modeli ifikiri kidogo.
Mtego mmoja wa kiutendaji: kubadilisha thamani ya effort ya ngazi ya juu kati ya maombi kunabatilisha prompt cache (nakala iliyohifadhiwa ya system prompt yako inayojirudia, ambayo hupunguza gharama). Badiliko la effort kwa kila ujumbe, ambalo kwa sasa liko katika beta, linahifadhi cache.
Wakala anayesimama kwa sababu alikuwa na adabu
Hali ya kuvutia zaidi ya kushindwa katika mwongozo ni ya kitabia. Kwenye kazi ndefu zenye sehemu nyingi, Opus 5.5 humweka mtumiaji ajue maendeleo wakati inafanya kazi, na baadhi ya taarifa hizo humaliza zamu kwa maandishi badala ya tool call (ombi la kutumia zana), na kurudisha stop_reason: "end_turn". Agent loop (mzunguko wa wakala) usiosimamiwa na mtu huchukulia hilo kama "kazi imekamilika" na hujizima. Kazi ilikuwa haijakamilika. Modeli ilikuwa inatoa ripoti.
Suluhisho za Anthropic ni za kawaida lakini zinafaa kunakiliwa: weka sehemu za kazi kwenye orodha ya ukaguzi (checklist) ambayo modeli inaisasisha, chukulia mwisho wa maandishi tu kama ripoti na si uthibitisho wa kukamilika, na tuma ujumbe mfupi unaotaja vipengele vilivyobaki wazi. Weka kikomo cha kuendelea kiotomatiki kwa mara mbili au tatu ili mzunguko uliokwama kweli ukome na ukaguliwe. Ikiwa amri ya usuli au subagent (wakala msaidizi) bado inaendeshwa, subiri matokeo yake kabla ya kuamua kwamba kazi imekamilika.
Mwongozo pia unatoa aya ndefu ya system prompt inayotaja njia nne mahususi ambazo modeli humaliza zamu mapema kupita kiasi, zikiwemo muhtasari unaotangaza hatua inayofuata bila kuichukua, na ofa za kuendelea zinazosubiri jibu ambalo hakuna anayelitoa. Anthropic inasema wazi kwamba ni kwa mawakala wasiosimamiwa kabisa tu, kwamba unapaswa kuweka hatua yako mwenyewe ya uthibitisho kwa vitendo visivyoweza kurudishwa nyuma, na kwamba inagharimu tool calls na output tokens zaidi kidogo kwa kila kazi. Kuiongeza katikati ya kikao kunabatilisha thinking blocks za awali za mazungumzo, kwa hiyo iwekwe tangu ombi la kwanza.
Maswali Unayopaswa Kujiuliza
- Ikiwa thinking haiwezi tena kuzimwa, kiwango chetu halisi cha chini cha muda hadi token ya kwanza kwa vipengele vya chat ni kipi, kikipimwa kwenye trafiki yetu wenyewe badala ya tathmini za Anthropic?
- Ni prompts zipi kati ya zetu zinazoagiza modeli iandike hoja zake kwenye jibu kama mbadala wa thinking? Hizo sasa zinaweza kukataliwa chini ya kategoria ya kukataa ya reasoning_extraction.
- Je, harness yetu ya wakala hukagua aina za content block, au inadhania kwamba block ya kwanza ni maandishi? Jibu linaweza kuanza na thinking block ambayo sehemu yake ni tupu chini ya mpangilio-msingi wa kuonyesha.
- Ni runs ngapi "zilizofanikiwa" zisizosimamiwa za robo iliyopita kwa kweli zilisimama kwenye ripoti ya maendeleo tuliyoihesabu kama kukamilika?
- Nani anamiliki mpangilio wa effort, na je, tunalipia xhigh kwenye kazi ambazo hatukuwahi kupima faida ya ubora?
Cha Kuangalia Baadaye
Angalia bili zako za tokens kwenye effort ile ile. Ikiwa gharama zinapanda baada ya kuhamia licha ya madai ya kasi ya asilimia 30 na matumizi madogo ya tokens kwa kila kazi, chanzo karibu kila mara ni thamani ya effort iliyobebwa pamoja na kikomo cha max_tokens kilichowekwa wakati thinking ilikuwa ya hiari. Ulinganisho huo mmoja, mzigo wa kazi ule ule kabla na baada, utakuambia kama Opus 5.5 ni nafuu kwako au ni ya haraka tu kwa benchmarks za Anthropic.
- 1Tafuta kwenye codebase yako (kwa grep) thinking: {"type": "disabled"} kabla ya kupandisha hadi Opus 5.5, kwa kuwa kigezo hicho sasa kinaleta hitilafu badala ya kupuuzwa.
- 2Badilisha miito ya disabled-thinking kwa kiwango cha chini kabisa cha effort, kisha pima upya latency na gharama kwa sababu thinking ya chini kabisa bado hutumia tokens.
- 3Jaribu upya prompt yoyote iliyoboreshwa kwa effort ya 'medium' kwenye Opus 5.5, kwa kuwa viwango vya effort vimepangwa upya na havitalingana na tabia ya Opus 5.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
