LLMs sem achismo

Muitas equipes colocam LLMs em produção confiando em testes manuais, boas impressões e pouca medição. Nesta palestra, vamos discutir como avaliar sistemas baseados em IA generativa com mais rigor: tipos de evals, métricas de qualidade, avaliação humana, LLM-as-Judge, riscos comuns e uso de evals no ciclo de desenvolvimento. A proposta é mostrar como tomar decisões melhores sobre modelos, prompts e mudanças em produção.