Svennis AI
10 min de citit

Opus, Sonnet sau Haiku: cum alegi modelul Claude potrivit pentru afacerea ta

Fable, Opus, Sonnet sau Haiku? Alegi după sarcină: capabilitate, viteză, cost și efort. Un tabel cu sarcini reale de firmă și un mod simplu de a testa alegerea pe exemplele tale.

Patru forme abstracte de mărimi diferite, legate prin linii care urcă de la simplu la complex

Opus, Sonnet sau Haiku: modelul Claude potrivit se alege după sarcină

Modelul Claude potrivit îl alegi după sarcină, nu după clasamente. Opus, Sonnet sau Haiku răspund la nevoi diferite. Anthropic recomandă Opus 5.5 ca punct de pornire pentru majoritatea lucrărilor. Haiku 4.5 se potrivește pentru volum mare și răspuns rapid. Sonnet 5 stă între ele, iar Fable 5.1 rămâne pentru cazurile cele mai grele.

Un model Claude este motorul de inteligență artificială care citește cererea ta și scrie răspunsul. Anthropic oferă acum patru niveluri pentru toți clienții: Fable 5.1, Opus 5.5, Sonnet 5 și Haiku 4.5. Toate primesc text și imagini, răspund în text, lucrează în mai multe limbi și pot folosi instrumente. Diferă prin cât de greu pot gândi, cât de repede răspund și cât costă.

Clasamentele de benchmark te ajută mai puțin decât par. Chiar Anthropic scrie că, la nivelul actual de capabilitate, diferențele din benchmark-uri au devenit un ghid mai puțin sigur pentru diferențele reale. De aceea ghidul de față leagă fiecare model de munci concrete dintr-o firmă: sortare, redactare, analiză și agenți care lucrează singuri. Fiecare model are și un articol separat pe site, legat mai jos.

Trei criterii de alegere a modelului Claude: capabilitate, viteză și cost

Anthropic propune trei criterii pentru alegerea unui model Claude: capabilitate, viteză și cost. Le cântărești împreună, pentru fiecare sarcină în parte. O sarcină care rulează de foarte multe ori pe zi cere alt echilibru decât un raport scris o dată pe lună. Criteriile sunt descrise în ghidul Anthropic despre alegerea modelului.

Capabilitatea

Capabilitatea înseamnă cât de complexă poate fi sarcina pe care modelul o duce corect la capăt. Raționamentul dificil și munca lungă, în mulți pași, cer modelele de sus. Clasificarea unui e-mail sau extragerea unui câmp dintr-o factură nu le cer.

Viteza

Viteza contează când un om așteaptă răspunsul, de exemplu într-un chat cu clienții. Haiku 4.5 are cea mai mică latență din gama Claude. Opus 5.5 are și un mod rapid, aflat în previzualizare, care scrie de până la 2,5 ori mai repede. Modul rapid costă 8 USD pe milion de tokeni de intrare și 40 USD pe milion de tokeni de ieșire.

Costul

Costul se plătește pe tokeni. Un token este o bucată de text: în engleză are cam 4 caractere, adică circa 0,75 cuvinte. Modelele mai noi folosesc un tokenizator care produce cu aproximativ 30% mai mulți tokeni pentru același text. Factura reală o afli deci doar rulând textele tale.

Nivelul de efort, de multe ori o pârghie mai bună decât schimbarea modelului

Parametrul de efort este o setare care schimbă, în interiorul aceluiași model, inteligență pe viteză și cost. Anthropic spune direct că ajustarea efortului este de multe ori o pârghie mai bună decât schimbarea modelului. Pentru o firmă, asta înseamnă mai puține migrări și mai puține teste de la zero.

Fiecare model Claude pornește de la un nivel implicit de efort:

  • Fable 5.1: efort implicit ridicat (high).
  • Opus 5.5: efort implicit mediu (medium).
  • Sonnet 5: efort implicit ridicat (high).
  • Haiku 4.5: nu are setare de efort și folosește gândire extinsă, pornită manual.

Regula practică este simplă. Înainte să urci de la Opus 5.5 la Fable 5.1, crește efortul pe Opus. Anthropic recomandă Fable 5.1 abia când testele tale pe Opus 5.5, la efort mai mare, tot nu ajung. Invers, înainte să cobori pe un model mai ieftin, încearcă un efort mai mic pe modelul pe care îl ai deja.

Modul de gândire diferă și el între modele. Fable 5.1 și Opus 5.5 folosesc gândire adaptivă, mereu pornită. Opus 5.5 nu mai poate fi folosit cu gândirea oprită.

Prețurile, contextul și efortul implicit pentru Fable, Opus, Sonnet și Haiku

Prețurile oficiale Claude sunt în dolari americani, per milion de tokeni, separat pentru intrare și ieșire. Intrarea este textul pe care îl trimiți, iar ieșirea este textul scris de model. Fereastra de context este cantitatea de text pe care modelul o poate lua în calcul într-o singură cerere. Tabelul adună cifrele de pe pagina de prețuri Anthropic și din prezentarea oficială a modelelor.

ModelIntrare / ieșire (USD per milion de tokeni)Fereastră de contextIeșire maximăEfort implicit
Fable 5.110 / 501M tokeni128K tokenihigh
Opus 5.54 / 201M tokeni128K tokenimedium
Sonnet 52 / 101M tokeni128K tokenihigh
Haiku 4.51 / 5200K tokeni64K tokeninu este suportat

Două reduceri schimbă mult factura. Batch API, adică trimiterea cererilor în loturi procesate asincron, are 50% reducere la intrare și la ieșire. Prompt caching refolosește părți de prompt deja procesate, iar o citire din cache costă 10% din prețul standard de intrare. La Opus 5.5, o citire din cache costă 0,20 USD pe milion de tokeni.

Diferența dintre niveluri este mare. Fable 5.1 costă de zece ori mai mult decât Haiku 4.5, la intrare și la ieșire. Pe de altă parte, Anthropic scrie că Opus 5.5 lucrează la nivelul lui Fable 5.1 pe majoritatea sarcinilor.

Haiku 4.5 ia în calcul cel mult 200K tokeni într-o cerere, celelalte trei modele până la un milion: Context Fable 5.1, Opus 5.5 și Sonnet 5 1 milion de tokeni, Context Haiku 4.5 200 mii de tokeni, Ieșire maximă Fable 5.1, Opus 5.5 și Sonnet 5 128 mii
Sursa: platform.claude.com

Două moduri de a începe: de la Haiku în sus sau de la Opus în jos

Anthropic descrie două moduri de a alege primul model Claude pentru o sarcină. Ambele funcționează. Diferă prin punctul de pornire și prin direcția în care ajustezi.

Eficiența întâi: pornești de la Haiku 4.5

Pornești cu Haiku 4.5, modelul cel mai rapid și cel mai ieftin. Treci la un model mai mare doar când măsori o diferență concretă de calitate pe exemplele tale. Varianta se potrivește sarcinilor repetitive, cu volum mare și reguli clare. Detaliile sunt în articolul despre Claude Haiku 4.5 pentru sarcinile repetitive din firmă.

Capabilitatea întâi: pornești de la Opus 5.5

Pornești cu Opus 5.5, pe care Anthropic îl recomandă pentru majoritatea lucrărilor. După ce fluxul de lucru merge bine, încerci un efort mai mic sau un model mai ieftin. Varianta se potrivește când sarcina e nouă, neclară sau grea. Articolul despre când merită Claude Opus 5.5 în firmă intră în detalii.

Dacă nu știi de unde să pornești, începe cu Opus 5.5. Așa afli întâi dacă sarcina se poate face bine. Abia apoi cauți varianta mai ieftină care păstrează calitatea.

Ce face fiecare model Claude, pe scurt: Fable, Opus, Sonnet și Haiku

Cele patru modele Claude disponibile acum acoperă niveluri diferite de dificultate. Descrierile folosesc formulările Anthropic. Detaliile de utilizare sunt în articolele separate de pe site.

Fable 5.1, pentru munca cea mai grea

Fable 5.1 este cel mai capabil model Anthropic deschis tuturor clienților. Anthropic îl recomandă pentru raționament dificil și pentru munca de agent pe termen lung. Costă 10 USD pe milion de tokeni de intrare și 50 USD pe milion de ieșire, de două ori și jumătate prețul lui Opus 5.5. Mythos 5.1 are aceleași capabilități, dar numai pentru participanții la Project Glasswing.

Opus 5.5, punctul de pornire recomandat

Opus 5.5 este construit pentru programare de tip agent și pentru muncă de cunoaștere care durează mult. Anthropic scrie că majoritatea sarcinilor încep cu Opus 5.5.

Sonnet 5, pentru munca de zi cu zi

Sonnet 5 oferă, în descrierea Anthropic, cea mai bună combinație de viteză și inteligență. Costă jumătate din Opus 5.5 și are aceeași fereastră de context de 1M tokeni. Articolul despre Sonnet 5 ca model de zi cu zi arată unde se potrivește: e-mailuri, rezumate și tichete.

Haiku 4.5, pentru viteză și volum

Haiku 4.5 este cel mai rapid model Claude, cu inteligență apropiată de vârf, și cel mai ieftin. Are o fereastră de context mai mică, de 200K tokeni, și o ieșire maximă de 64K tokeni. Primește text și imagini, deci poate citi și o factură scanată.

Tabel de decizie: sarcini reale de firmă și modelul Claude cu care începi

Tabelul leagă sarcini tipice dintr-o firmă mică de modelul Claude cu care merită să începi. Exemplele vin din munca obișnuită: date din Zoho CRM, un inbox de suport în Zoho Desk, facturi și cercetare. Ultimele două coloane arată semnul că trebuie să urci sau să cobori un nivel.

SarcinăModelul de pornireSemn că urciSemn că cobori
Ofertă pentru un client, din notițe și prețuriSonnet 5Argumentele tehnice ies incoerente: treci pe Opus 5.5Textele ies la fel de bune pe Haiku 4.5 în testul tău
Raport lunar de management din datele CRMOpus 5.5, efort mediumCifre citite greșit sau concluzii superficiale: crești efortul, apoi Fable 5.1Raportul are aceeași formă lunar și iese corect pe Sonnet 5
Sortarea inboxului de suportHaiku 4.5Tichete puse în categorii greșite: trimiți cazurile nesigure la Opus 5.5Mutarea pe Batch API a reclasificării care nu e urgentă
Extragerea câmpurilor din facturiHaiku 4.5Câmpuri lipsă pe facturi neobișnuite: treci pe Sonnet 5Arhivele vechi le procesezi prin Batch API, la jumătate de preț
Cercetare lungă pe multe documenteOpus 5.5Concluzii incomplete chiar la efort mare: treci pe Fable 5.1Întrebări scurte, pe puține documente, pe Sonnet 5
Agent care lucrează printr-un backlog de sarciniOpus 5.5Abandonează sarcinile lungi sau greșește pașii: treci pe Fable 5.1Sarcinile simple le delegi la Haiku 4.5, ca sub-agent

Semnele din tabel se măsoară pe exemplele tale, nu pe impresie. Un singur răspuns slab nu justifică un model mai scump. Un tipar de greșeli pe același tip de caz îl justifică.

Combinarea modelelor Claude: unul ieftin face volumul, unul puternic decide cazurile grele

O strategie cu mai multe modele pune un model ieftin să facă cea mai mare parte a muncii și un model de vârf să intervină doar unde e nevoie. Astfel, majoritatea tokenilor se facturează la prețul mic. Anthropic descrie două tipare comune:

  • Executantul care escaladează la un consilier: modelul ieftin lucrează și cere ajutorul modelului mare la cazurile grele.
  • Orchestratorul care deleagă: modelul mare împarte munca și trimite bucățile simple la modele mai ieftine.

Exemplu: sortarea tichetelor de suport cu Haiku 4.5 și Opus 5.5

Ia un inbox de suport în care fiecare mesaj trebuie pus într-o categorie și trimis omului potrivit. Pe API, alegerea modelului înseamnă un identificator de model trimis la fiecare cerere. Fluxul poate arăta așa:

  1. Fiecare tichet nou merge la Haiku 4.5, cu identificatorul claude-haiku-4-5, care alege categoria și prioritatea.
  2. Haiku marchează separat tichetele la care nu e sigur, de exemplu o reclamație legată de contract.
  3. Tichetele marcate merg la Opus 5.5, cu identificatorul claude-opus-5-5, la efortul implicit medium, care decide și propune un răspuns.
  4. Un om din echipă verifică răspunsul propus înainte de trimitere.
  5. Reclasificarea arhivei, care nu e urgentă, rulează noaptea prin Batch API, cu 50% reducere.

La Svennis, când construim un asistent de acest fel, lăsăm modelul ieftin să sorteze și trimitem la modelul mare doar cazurile marcate ca nesigure. Înainte de lansare verificăm pe tichete reale că regula de escaladare prinde exact cazurile grele, nu și pe cele simple.

Unde ajung datele când folosești Claude dintr-o firmă din România sau din UE

Pe API-ul Anthropic, datele tale sunt stocate azi în Statele Unite. Două setări separate decid unde ajung datele. Workspace geo stabilește unde sunt stocate datele în repaus și unde rulează procesări precum transcodarea imaginilor și execuția de cod. Inference geo stabilește unde rulează modelul, la fiecare cerere.

Pentru o firmă din România, din restul UE sau din Marea Britanie, contează trei lucruri din documentația Anthropic:

  • Singura opțiune de workspace geo disponibilă acum este „us”, iar setarea nu se mai poate schimba după crearea workspace-ului.
  • Inference geo are implicit valoarea „global”, adică inferența poate rula în orice geografie disponibilă.
  • Inferența doar în SUA costă de 1,1 ori tariful standard pe modelele noi. Pe Haiku 4.5 parametrul nu este suportat și întoarce o eroare 400.

Prin urmare, Anthropic nu oferă singur stocare în UE sau în Marea Britanie. Modelele Claude sunt disponibile și prin Amazon Bedrock, Google Cloud și Microsoft Foundry, fiecare cu propriii identificatori de model. Bedrock și Google Cloud au propriile prețuri regionale. Dacă ai nevoie de procesare în UE, acolo cauți, iar regiunea exactă pentru modelul ales o verifici pe pagina platformei respective.

Opus 5.5 este disponibil și cu retenție zero a datelor. Anthropic mai spune că modelul vine cu măsuri de marcare (watermarking) pentru conformarea cu AI Act-ul european. Detaliile tehnice sunt pe pagina Anthropic despre rezidența datelor.

Cum testezi alegerea modelului Claude: douăzeci de exemple reale pe două modele

Testul pe exemplele tale este cel mai sigur mod de a alege modelul Claude. Anthropic numește un set de evaluare specific cazului tău cel mai important pas în decizia de a schimba modelul. Pentru o firmă mică, douăzeci de exemple reale ajung ca să vezi diferența. Pașii sunt aceiași pentru orice sarcină:

  1. Alege o singură sarcină din tabelul de decizie, de exemplu sortarea tichetelor.
  2. Strânge douăzeci de exemple reale, cu tot cu cazurile grele și ciudate. Scoate din ele datele personale care nu sunt necesare.
  3. Scrie pentru fiecare exemplu răspunsul corect, așa cum l-ar da cel mai bun om din echipă.
  4. Rulează aceleași exemple, cu același prompt, pe două modele, de exemplu Haiku 4.5 și Opus 5.5.
  5. Compară răspunsurile cu cele corecte, fără să știi care model a scris ce.
  6. Compară factura: tokenii de intrare și de ieșire, înmulțiți cu prețul fiecărui model.

Rulează testul prin Batch API și plătești jumătate. Dacă Claude răspunde din documentele firmei, articolul despre o bază de cunoștințe pentru Claude, cu documente și teste arată cum păstrezi exemplele la zi.

Păstrează setul de exemple, pentru că modelele se schimbă. Anthropic anunță că noi versiuni Sonnet și Haiku vor urma în săptămânile următoare, fără o dată. Sfaturile din acest ghid țin de nivel, nu de numărul versiunii. Când apare un model nou, rulezi din nou același test.

Pașii următori pentru alegerea modelului Claude în firma ta

Alegerea modelului Claude devine simplă când o legi de o sarcină și de un buget. Pașii de mai jos pot fi urmați de orice firmă, fără o echipă tehnică mare:

  1. Alege o sarcină care se repetă în fiecare săptămână și care consumă timpul echipei.
  2. Găsește sarcina în tabelul de decizie și pornește pe modelul recomandat acolo.
  3. Construiește setul de douăzeci de exemple și rulează-l pe două modele.
  4. Păstrează modelul mai ieftin dacă răspunsurile ies la fel de bune.
  5. Încearcă întâi un alt nivel de efort, înainte să schimbi modelul.
  6. Pune costul în bugetul anual, alături de licențe și de timpul de configurare.

Pentru ultimul pas, articolul despre cât costă Claude pe an pentru zece angajați arată ce mai intră în buget pe lângă tokeni. Pornește cu o singură sarcină, măsoar-o și abia apoi extinde.

Surse

  1. 1. Choosing the right model - Claude Platform Docs
  2. 2. Models overview - Claude Platform Docs
  3. 3. Pricing - Claude Platform Docs
  4. 4. Data residency - Claude Platform Docs
  5. 5. Introducing Claude Opus 5.5 - Anthropic
  6. 6. Claude Haiku 4.5 - Claude Platform Docs
  7. 7. Newsroom - Anthropic

Articole similare