Testare le risposte di Claude prima del lancio significa far girare l'assistente su un insieme fisso di domande reali e casi limite. Ogni risposta si confronta con criteri di accettazione scritti in anticipo. Il sistema si approva solo quando li rispetta tutti, e il test si ripete a ogni modifica.
Il centro del lavoro è il set di valutazione. Un set di valutazione è l'elenco dei casi di prova. Per ciascun caso indica l'input e la risposta attesa, oppure le regole che la risposta deve rispettare. Anthropic usa lo stesso ragionamento per la scelta del modello. La sua pagina di panoramica dei modelli suggerisce di passare a Claude Fable 5.1 in un caso preciso. È quando le valutazioni su Claude Opus 5.5 restano insufficienti, anche con effort più alto.
Un criterio di accettazione è una condizione verificabile che decide se una risposta passa o no. Si scrive prima del test, non dopo. "Risponde bene" non è un criterio. "Cita la procedura corretta e apre il ticket nella coda giusta" lo è.
Questa guida segue l'ordine pratico del lavoro. Si parte dal contratto dell'assistente e si raccolgono i casi reali. Poi si aggiungono i casi limite e i tentativi di manipolazione. Infine si fissano i criteri in una tabella e si prova tutto su un esempio. L'ultima decisione riguarda quando ripetere i test.
