Un set de test pentru răspunsurile Claude este o listă de cereri reale ale clienților tăi. Fiecare cerere are lângă ea răspunsul așteptat sau regulile pe care răspunsul trebuie să le respecte. Îl construiești înainte de lansare. Apoi îl rulezi din nou după fiecare schimbare de prompt, de model sau de documente. Așa afli înaintea clienților că ceva s-a stricat.
Promptul înseamnă instrucțiunile pe care i le dai lui Claude: rolul, tonul, regulile și ce are voie să promită. O modificare mică în prompt poate repara un răspuns și poate strica alte trei. Fără un set de test, observi asta abia când un client se plânge.
Seturile de test pentru răspunsurile Claude nu sunt o idee de laborator. Documentația de modele a Anthropic pornește de la premisa că ai deja astfel de teste. Ea recomandă Claude Fable 5.1 pentru raționament dificil. Îl recomandă și atunci când „evals”, adică testele tale, pe Claude Opus 5.5 la efort mai mare tot nu ajung. Cu alte cuvinte, chiar furnizorul îți spune să alegi modelul după rezultatele pe cererile tale.
Multe firme se bazează în schimb pe impresie. Cineva încearcă cinci întrebări, răspunsurile sună bine și sistemul pleacă în producție. Un set de test înlocuiește impresia cu o listă pe care o poți număra: câte cereri au trecut, câte nu și care anume.
