Muitas equipes colocam LLMs em produção confiando em testes manuais, boas impressões e pouca medição. Nesta palestra, vamos discutir como avaliar sistemas baseados em IA generativa com mais rigor: tipos de evals, métricas de qualidade, avaliação humana, LLM-as-Judge, riscos comuns e uso de evals no ciclo de desenvolvimento. A proposta é mostrar como tomar decisões melhores sobre modelos, prompts e mudanças em produção.
LLMs sem achismo
Publicado em 23 de agosto de 2026 - Por Marcos Siriaco - 0 visualizações

