Notas para quem quer o porquê.
Datasets rotulados, scorers e uma comparação contra baseline que provam que uma mudança de prompt, retrieval ou modelo realmente ajudou — em vez de shippar com base em uns traces que pareciam ok.
Carregando biblioteca…