Svennis AI
10 min de citit

Migrarea la Claude Opus 5.5: costuri, viteză, schimbări și ce verifici înainte

Opus 5.5 are tokeni cu 20% mai ieftini și output cu peste 30% mai rapid decât Opus 5. Patru schimbări pot însă opri codul existent. Iată ce verifici și cum calculezi factura.

Două fluxuri abstracte paralele care se contopesc într-unul singur, mai subțire și mai rapid

Migrarea la Claude Opus 5.5 aduce costuri mai mici și viteză mai mare, cu patru schimbări de cod

Migrarea la Claude Opus 5.5 merită planificată pentru orice sistem care rulează azi pe Claude Opus 5. Costuri, viteză, schimbări: tokenii costă cu 20% mai puțin, Anthropic anunță un cost total cu 40% mai mic pe sarcini tipice și un output cu peste 30% mai rapid. Riscul stă în patru modificări care pot opri codul existent.

Migrarea de model este schimbarea modelului apelat de un sistem aflat deja în producție. Asta înseamnă identificatorul din cod plus tot ce depinde de comportamentul modelului: parametrii trimiși, felul în care citești răspunsul și costul lunar. Un asistent care triază tichete sau redactează oferte poate arăta la fel după schimbare și totuși să se comporte altfel.

Ghidul de față tratează strict trecerea de pe Opus 5 pe Opus 5.5. Dacă vrei să afli când merită Opus 5.5 față de un model mai ieftin, găsești asta în ghidul despre Claude Opus 5.5 în firmă. Aici găsești prețurile comparate, schimbările care dau erori, termenul până la care Opus 5 rămâne disponibil, un calcul lunar pe ambele modele și o listă de verificare.

Prețurile Claude Opus 5.5 față de Opus 5, pe fiecare tip de token

Claude Opus 5.5 costă 4 dolari pe milion de tokeni de intrare și 20 de dolari pe milion de tokeni de ieșire. Claude Opus 5 costă 5 și 25 de dolari. Un token este o bucată de text procesată de model, cam 4 caractere în engleză. Toate prețurile de pe pagina de prețuri Anthropic sunt în dolari americani.

Cea mai mare reducere este la citirile din cache. Prompt caching este funcția care refolosește părțile deja procesate ale unui prompt, de exemplu instrucțiunile fixe sau documentele trimise la fiecare cerere. Anthropic scrie că citirile din cache formează majoritatea costurilor în munca agentică și în programare.

Tip de token (USD pe milion)Opus 5Opus 5.5Diferență
Intrare54-20%
Ieșire2520-20%
Scriere în cache, 5 minute6,255-20%
Scriere în cache, 1 oră108-20%
Citire din cache0,500,20-60%
Batch, intrare / ieșire2,50 / 12,502 / 10-20%

Batch API este procesarea asincronă a unui volum mare de cereri, cu 50% reducere la intrare și la ieșire. Reducerea se aplică pe ambele modele, iar prețurile batch din tabel vin din ea. Limitele rămân identice: fereastra de context este de 1M tokeni, iar output-ul maxim este de 128K tokeni pe fiecare dintre cele două modele.

Pe Opus 5.5 un milion de tokeni de ieșire costă 20 USD, față de 25 USD pe Opus 5: Ieșire, Opus 5 25, Ieșire, Opus 5.5 20, Intrare, Opus 5 5, Intrare, Opus 5.5 4 (USD pe milion de tokeni)
Sursa: platform.claude.com

Reducerea de 40% anunțată de Anthropic este o estimare de cost total, nu un preț

Cifra de 40% este estimarea Anthropic pentru costul total al lui Opus 5.5 la setările implicite, pe sarcini tipice, față de Opus 5. Ea nu apare în lista de prețuri. Prețul pe token explică doar 20% din diferență, așa că restul vine din felul în care rulează modelul.

O diferență documentată este efortul implicit. Efortul este parametrul care controlează adâncimea thinking-ului, latența și costul. O cerere fără efort setat rulează la medium pe Opus 5.5 și rula la high pe Opus 5. Thinking-ul este raționamentul intern pe care modelul îl face înainte de răspuns, iar tokenii lui se plătesc.

Pentru bugetul tău, trei lucruri decid cât din acești 40% vezi pe factură:

  • cât de mult din intrare îți vine din cache, unde reducerea este de 60%;
  • dacă ai setat explicit efortul la high în cod, caz în care nu profiți de noua valoare implicită;
  • cât de lungi sunt răspunsurile cerute de fluxul tău.

Testele Anthropic au rulat pe sarcinile Anthropic. Un asistent care scrie răspunsuri lungi pentru clienți are alt profil decât unul care doar clasifică tichete. Estimarea de 40% este un punct de plecare, iar cifra reală o dă factura ta după câteva săptămâni pe noul model.

Viteza și calitatea Opus 5.5, după măsurătorile Anthropic

Anthropic spune că Opus 5.5 generează output cu peste 30% mai rapid decât Opus 5. Pentru un asistent folosit de oameni în timp real, viteza se simte direct. Exemple sunt un chat intern sau un draft de răspuns așteptat de un agent de suport. Pentru un raport generat noaptea, contează mai puțin.

La calitate, Anthropic afirmă că Opus 5.5 lucrează la nivelul lui Claude Fable 5.1 pe majoritatea sarcinilor. Fable 5.1 costă 10 dolari la intrare și 50 la ieșire pe milion de tokeni, deci de două ori și jumătate mai mult. Un exemplu vine din tabelul publicat de Anthropic, pe GDPval-AA v2.1. Acolo Opus 5.5 obține 1846 Elo la efort maxim, Fable 5.1 are 1735, iar Opus 5 are 1708.

Acestea sunt măsurătorile Anthropic, cu Opus 5.5 la efort maxim, nu la setarea implicită. Anthropic recunoaște chiar în anunț o limită a acestor cifre. La acest nivel de capabilitate, diferențele din benchmark-uri au devenit un ghid mai puțin sigur pentru lumea reală. Concluzia practică este simplă: benchmark-ul îți spune că merită testat, iar cazurile tale reale îți spun dacă merită mutat.

Opus 5.5 are și un fast mode, o variantă cu latență mai mică. Costă 8 dolari la intrare și 40 la ieșire pe milion de tokeni. Este în research preview și rulează doar pe Claude API, nu pe Amazon Bedrock, Claude Platform on AWS, Google Cloud sau Microsoft Foundry.

Patru schimbări din Opus 5.5 care pot opri un sistem care rulează pe Opus 5

Documentația What's new in Claude Opus 5.5 listează patru schimbări care afectează codul scris pentru Opus 5. Primele trei se aplică și pe Claude Fable 5.1, deci aceeași curățenie în cod te ajută dacă vei trece vreodată acolo.

Thinking-ul nu mai poate fi oprit

Pe Opus 5.5, thinking-ul este mereu pornit. O cerere cu thinking: {"type": "disabled"} întoarce eroarea 400 invalid_request_error. Același lucru se întâmplă cu un buget manual, {"type": "enabled", "budget_tokens": N}. Adâncimea thinking-ului se reglează acum doar prin efort.

Forced tool use nu mai este acceptat

Forced tool use înseamnă că obligi modelul să apeleze un instrument, de exemplu funcția care creează un lead. Pe Opus 5.5, tool_choice cu {"type": "any"} sau {"type": "tool", "name": "..."} dă eroare 400. Soluția este auto, cu instrucțiuni clare despre când trebuie folosit instrumentul.

Blocurile de thinking sunt legate de model și de conversație

Opus 5.5 citește blocurile de thinking produse de Opus 5 și de modelele Opus, Sonnet și Haiku mai vechi. Nu le citește pe cele produse de Fable sau Mythos. Un bloc pe care nu îl poate citi este eliminat, cererea reușește, iar blocul nu se facturează. Pentru conturile create din 31 august 2026, API-ul respinge implicit cu 400 blocurile de thinking retrimise după ce ai modificat contextul anterior.

Vechiul instrument de computer use este respins

Pe Claude API și Google Cloud, Opus 5.5 respinge instrumentul computer_20251124. Pe Amazon Bedrock, acesta funcționează în continuare, deci acolo nu trebuie să schimbi nimic.

Pe Opus 5.5 thinking-ul e mereu pornit, iar forced tool use și bugetul manual sunt respinse. Opus 5 / Opus 5.5 / Ce faci. Thinking dezactivat: Acceptat / Cerere respinsă, thinking mereu pornit / Ștergi setarea disabled; Buget manual budget_tokens: Ac

Efortul implicit medium, mesajele de progres și refuzurile în Opus 5.5

Trei comportamente noi din Opus 5.5 nu dau erori, dar schimbă ce vede utilizatorul. Tocmai de aceea trec ușor neobservate într-un test rapid.

Primul este efortul implicit medium. Un flux care pe Opus 5 rula implicit la high va gândi acum mai puțin, dacă nu setezi altceva. Pentru clasificări și rezumate diferența poate fi mică. Pentru analize cu mai mulți pași merită să rulezi aceleași cazuri la ambele niveluri.

Al doilea privește textul scris între apelurile de instrumente. Pe Opus 5.5, acest text vine ca blocuri de thinking, nu ca blocuri de text. La setarea implicită de afișare, display: "omitted", textul lor este gol. Un asistent care le arăta utilizatorilor mesaje de progres, de tipul „caut în CRM”, tace între apeluri, fără nicio eroare. Dacă ai un asistent în chat-ul echipei, așa cum e descris în ghidul despre Claude în Microsoft 365 și Teams, setează o valoare de afișare care returnează textul.

Al treilea este refuzul. O cerere refuzată întoarce HTTP 200 cu stop_reason: "refusal" și un obiect stop_details care numește zona de politică. Un cod care verifică doar statusul HTTP va trata refuzul ca pe un răspuns reușit. Verifică explicit stop_reason înainte să salvezi răspunsul undeva.

Claude Opus 5 rămâne disponibil cel puțin până pe 24 iulie 2027

Opus 5 nu dispare mâine. Pagina modelului îl arată cu statusul Active (legacy), lansat pe 24 iulie 2026, cu retragere nu mai devreme de 24 iulie 2027. Legacy înseamnă că modelul nu mai primește actualizări și poate fi declarat depreciat în viitor.

Conform politicii Anthropic de retragere a modelelor, clienții cu sisteme active primesc cel puțin 60 de zile de preaviz înainte de retragerea unui model public. După retragere, cererile către model eșuează. Datele se aplică pe Claude API, Claude Platform on AWS și Microsoft Foundry. Amazon Bedrock și Google Cloud își stabilesc propriile calendare, deci statusul poate diferi acolo.

Ai deci timp să testezi fără grabă. Primul pas este să afli exact unde folosești Opus 5. Din pagina Usage din Claude Console poți exporta un fișier CSV cu consumul defalcat pe cheie API și pe model. Firmele cu mai multe integrări descoperă des că același model e apelat din trei locuri diferite.

Opus 5.5 a fost lansat pe 22 septembrie 2026 și nu va fi retras mai devreme de 22 septembrie 2027. Documentația Anthropic recomandă Opus 5.5 ca punct de plecare pentru majoritatea sarcinilor, când nu ești sigur ce model să alegi.

Exemplu calculat: un asistent de suport în Zoho Desk, pe Opus 5 și pe Opus 5.5

Un asistent care triază tichete în Zoho Desk și redactează răspunsuri arată bine cum se schimbă factura. Să presupunem un volum lunar ipotetic: 10 milioane de tokeni de intrare obișnuită, adică textul tichetelor. Mai sunt 40 de milioane de tokeni citiți din cache, pentru instrucțiunile fixe și articolele din baza de cunoștințe. La ieșire sunt 4 milioane de tokeni, pentru clasificări și draft-uri.

Componentă lunarăOpus 5 (USD)Opus 5.5 (USD)
10M tokeni intrare5040
40M tokeni citiți din cache208
4M tokeni ieșire10080
Total170128

La același număr de tokeni, economia este de 42 de dolari pe lună, cam 25%. Procentul trece de 20% datorită cache-ului, care se ieftinește cu 60%. Pentru simplitate, calculul lasă deoparte scrierile în cache, care sunt și ele cu 20% mai ieftine pe Opus 5.5.

Diferența până la cei 40% anunțați ar veni din tokeni mai puțini pe sarcină, adică mai puțin thinking la efort medium. Asta nu se poate calcula dinainte, se măsoară. Dacă același asistent generează noaptea și un raport prin Batch API, cu 5 milioane de tokeni la intrare și 1 milion la ieșire, costul scade de la 25 la 20 de dolari.

Migrarea la Opus 5.5 pentru o firmă din România: dolari, facturare și watermark

Pentru o firmă din România, prețurile Claude sunt în dolari. Costul tău în lei se mișcă deci și cu cursul valutar, nu doar cu consumul. Când faci bugetul pe an, pune o marjă pentru curs, așa cum arătăm în calculul costului anual Claude pentru zece angajați. Dacă folosești Claude prin Claude Platform on AWS sau Microsoft Foundry, consumul în dolari se convertește în Claude Consumption Units, la 0,01 dolari per unitate.

Al doilea subiect este marcajul textului generat. Din 2 august, Uniunea Europeană cere furnizorilor de AI care servesc piața ei să marcheze conținutul generat de AI. Opus 5.5 vine cu măsurile Anthropic de watermark pentru conformitatea cu EU AI Act. Watermark-ul este un tipar lăsat în alegerea cuvintelor, invizibil pentru cititor, dar detectabil de cine are cheia.

Pentru un sistem de business, asta are trei consecințe practice:

  • textul nu primește nimic în plus, nici caractere ascunse;
  • watermark-ul nu consumă tokeni suplimentari, deci nu costă nimic;
  • marcajul nu poate fi legat de o persoană, o organizație sau o conversație anume.

Anthropic aplică watermark-ul global, pentru că nu are încă o metodă durabilă de a-l limita pe regiuni. Răspunsurile în română trimise clienților tăi arată deci exact ca înainte, iar codul nu trebuie modificat din cauza lui.

Lista de verificare pentru migrarea de pe Opus 5 pe Opus 5.5, pas cu pas

Lista de mai jos pune pașii migrării în ordinea în care îi faci, fiecare cu ce verifici la final. Nu sări direct la schimbarea identificatorului în producție.

PasCe faciCe verifici
1. InventarExporți CSV-ul de consum din pagina UsageToate cheile API care apelează Opus 5
2. IdentificatorSchimbi claude-opus-5 în claude-opus-5-5 (pe Bedrock, anthropic.claude-opus-5-5)Cererea ajunge la noul model
3. ThinkingȘtergi setările disabled și budget_tokensNicio eroare 400
4. InstrumenteTreci tool_choice pe auto și scoți computer_20251124Modelul apelează instrumentul când trebuie
5. Afișare și refuzuriSetezi afișarea textului de progres și verifici stop_reasonUtilizatorul vede progresul, refuzurile nu se salvează
6. TestRulezi douăzeci de cazuri reale pe ambele modele, la medium și highCalitatea răspunsurilor, caz cu caz
7. FacturăCompari consumul după câteva săptămâniCostul real față de calculul inițial

Pasul 6 decide totul. La Svennis alegem cazurile de test din tichetele și înregistrările reale ale clientului, cu răspunsul corect notat de omul care face zilnic munca respectivă, nu din exemple scrise pentru test. Metoda seamănă cu testele din ghidul despre baza de cunoștințe pentru Claude, unde fiecare întrebare are un răspuns verificat.

Următorii pași pentru migrarea la Claude Opus 5.5, începând de săptămâna aceasta

Primul pas concret este inventarul: exportă CSV-ul de consum și notează fiecare sistem care apelează Opus 5. Pentru fiecare, trece în dreptul lui dacă folosește thinking dezactivat, forced tool use sau mesaje de progres. Acestea sunt locurile unde migrarea poate rupe ceva.

Al doilea pas este setul de douăzeci de cazuri reale. Pentru un asistent legat de Zoho CRM, ia lead-uri, oferte sau follow-up-uri din ultima lună, cu rezultatul corect scris de omul care le-a tratat. Rulează-le pe Opus 5 și pe Opus 5.5, într-un mediu de test, apoi compară.

Al treilea pas este decizia. Dacă Opus 5.5 la efort mai mare tot nu atinge calitatea de care ai nevoie, documentația Anthropic recomandă Claude Fable 5.1 pentru raționamente dificile și sarcini agentice lungi.

Dacă, dimpotrivă, un flux merge bine și pe un model mai ieftin, poți muta doar partea grea pe Opus 5.5. Criteriile de alegere pe fiecare sarcină sunt în ghidul despre alegerea între Opus, Sonnet și Haiku. Termenul de retragere a lui Opus 5, cel mai devreme 24 iulie 2027, îți lasă timp să faci toți pașii fără presiune.

Surse

  1. 1. Anthropic: Introducing Claude Opus 5.5
  2. 2. Claude Platform Docs: What's new in Claude Opus 5.5
  3. 3. Claude Platform Docs: Claude Opus 5.5
  4. 4. Claude Platform Docs: Claude Opus 5
  5. 5. Claude Platform Docs: Pricing
  6. 6. Claude Platform Docs: Model deprecations
  7. 7. Claude Platform Docs: Models overview
  8. 8. Anthropic Newsroom
  9. 9. Anthropic: How Claude's text watermarking works

Articole similare