1

Muito bom. Essa distinção entre “schema válido” e “intenção correta” era exatamente o ponto que eu estava tentando formular.

Gostei especialmente da regra de não regravar o golden só para deixar verde. Em sistemas com LLM, esse tipo de disciplina parece mais importante do que em teste tradicional, porque é fácil confundir melhoria real com adaptação ao teste.

Uma coisa que fiquei pensando: você versiona esses casos por mudança de prompt/modelo também, ou mantém a suíte mais ligada ao comportamento esperado do produto?

Carregando publicação patrocinada...