{"id":87,"date":"2025-07-08T11:00:00","date_gmt":"2025-07-08T14:00:00","guid":{"rendered":"https:\/\/dcoder.io\/blog\/?p=87"},"modified":"2026-08-30T15:27:32","modified_gmt":"2026-08-30T18:27:32","slug":"conjunto-ouro-teste-de-agente-de-ia","status":"publish","type":"post","link":"https:\/\/dcoder.io\/blog\/conjunto-ouro-teste-de-agente-de-ia\/","title":{"rendered":"Conjunto-ouro: como testar um agente de IA antes de colocar na frente do cliente"},"content":{"rendered":"<p><strong>Um conjunto-ouro \u00e9 uma lista de perguntas reais com a resposta certa j\u00e1 definida por quem entende do assunto.<\/strong> Voc\u00ea roda o agente contra essa lista, conta os acertos, e passa a ter um n\u00famero. Cem perguntas resolvem a maior parte dos casos, e montar leva menos de um dia de trabalho.<\/p>\n<p>Sem ele, a avalia\u00e7\u00e3o de um agente \u00e9 algu\u00e9m da equipe conversando por dez minutos e dizendo &#8220;ficou bom&#8221;. Isso n\u00e3o \u00e9 teste: \u00e9 demonstra\u00e7\u00e3o, e demonstra\u00e7\u00e3o sempre funciona.<\/p>\n<h2>Por que testar assim, e n\u00e3o usando<\/h2>\n<p>Um modelo de linguagem n\u00e3o \u00e9 determin\u00edstico. A mesma pergunta pode receber respostas diferentes, e uma sess\u00e3o de conversa livre s\u00f3 mostra o que o testador lembrou de perguntar \u2014 quase sempre as perguntas f\u00e1ceis, e quase sempre com a reda\u00e7\u00e3o certa.<\/p>\n<p>O conjunto-ouro inverte isso: fixa as perguntas, fixa o gabarito, e transforma a avalia\u00e7\u00e3o em contagem. A\u00ed d\u00e1 para comparar vers\u00f5es, comparar fornecedores, e saber se a mudan\u00e7a de ontem melhorou ou piorou.<\/p>\n<h2>Como montar as cem perguntas<\/h2>\n<h3>De onde tirar<\/h3>\n<p>Do hist\u00f3rico real, sempre. Atendimento tem conversa arquivada; suporte tem chamado; comercial tem e-mail. Perguntas inventadas em reuni\u00e3o testam o sistema contra a imagina\u00e7\u00e3o da equipe, e a imagina\u00e7\u00e3o da equipe \u00e9 otimista.<\/p>\n<h3>A distribui\u00e7\u00e3o que funciona<\/h3>\n<table>\n<tr>\n<th>Tipo<\/th>\n<th>Quantas<\/th>\n<th>Por qu\u00ea<\/th>\n<\/tr>\n<tr>\n<td>Perguntas comuns, reda\u00e7\u00e3o normal<\/td>\n<td>40<\/td>\n<td>O grosso do uso real.<\/td>\n<\/tr>\n<tr>\n<td>Mesmas perguntas, reda\u00e7\u00e3o ruim<\/td>\n<td>20<\/td>\n<td>Com erro de digita\u00e7\u00e3o, g\u00edria, abrevia\u00e7\u00e3o, \u00e1udio transcrito.<\/td>\n<\/tr>\n<tr>\n<td>Casos de borda<\/td>\n<td>20<\/td>\n<td>Exce\u00e7\u00e3o, situa\u00e7\u00e3o rara, cliente com contrato diferente.<\/td>\n<\/tr>\n<tr>\n<td>Fora de escopo<\/td>\n<td>10<\/td>\n<td>O agente precisa saber dizer que n\u00e3o sabe.<\/td>\n<\/tr>\n<tr>\n<td>Armadilhas<\/td>\n<td>10<\/td>\n<td>Pergunta com premissa falsa, pedido de desconto n\u00e3o autorizado, dado sens\u00edvel.<\/td>\n<\/tr>\n<\/table>\n<p>As trinta \u00faltimas linhas s\u00e3o as que importam. Todo agente acerta as quarenta primeiras. Nenhum projeto quebra por causa delas.<\/p>\n<h3>Quem define o gabarito<\/h3>\n<p>A pessoa que hoje responde essas perguntas na empresa, n\u00e3o quem est\u00e1 construindo o sistema. E o gabarito precisa dizer duas coisas: qual \u00e9 a resposta certa, e o que <em>n\u00e3o pode<\/em> aparecer na resposta.<\/p>\n<h2>Como pontuar<\/h2>\n<p>Tr\u00eas colunas por pergunta, avaliadas por uma pessoa:<\/p>\n<ul>\n<li><strong>Certo<\/strong> \u2014 a informa\u00e7\u00e3o est\u00e1 correta e completa.<\/li>\n<li><strong>Incompleto<\/strong> \u2014 est\u00e1 certo, mas falta algo que o cliente precisaria.<\/li>\n<li><strong>Errado<\/strong> \u2014 informa\u00e7\u00e3o incorreta, ou inventada.<\/li>\n<\/ul>\n<p>E uma quarta coluna, separada de todas: <strong>perigoso<\/strong>. Marca a resposta que exp\u00f4s dado que n\u00e3o devia, prometeu o que a empresa n\u00e3o cumpre, ou deu orienta\u00e7\u00e3o que gera risco jur\u00eddico.<\/p>\n<p>Esta \u00faltima n\u00e3o entra em percentual. <strong>Uma resposta perigosa \u00e9 motivo para n\u00e3o subir<\/strong>, mesmo com 97% de acerto no resto.<\/p>\n<h2>Que nota \u00e9 boa<\/h2>\n<p>Depende inteiramente do que acontece com o erro:<\/p>\n<ul>\n<li><strong>Agente que apenas sugere, e um humano envia:<\/strong> a barra \u00e9 mais baixa, porque existe revis\u00e3o.<\/li>\n<li><strong>Agente que responde direto ao cliente:<\/strong> a barra sobe, e o transbordo para humano precisa funcionar bem.<\/li>\n<li><strong>Agente que toma a\u00e7\u00e3o \u2014 cancela, aprova, agenda, cobra:<\/strong> a barra \u00e9 alta e a resposta perigosa tem toler\u00e2ncia zero.<\/li>\n<\/ul>\n<p>Definir esse limiar antes de rodar o teste \u00e9 metade do valor do exerc\u00edcio. Definir depois \u00e9 escolher a r\u00e9gua que d\u00e1 o resultado desejado.<\/p>\n<h2>O que fazer depois de rodar<\/h2>\n<ol>\n<li><strong>Leia os erros um por um.<\/strong> Eles costumam se agrupar em dois ou tr\u00eas padr\u00f5es, e cada padr\u00e3o tem uma corre\u00e7\u00e3o s\u00f3.<\/li>\n<li><strong>Corrija a fonte, n\u00e3o a resposta.<\/strong> Se o agente errou porque a informa\u00e7\u00e3o interna est\u00e1 desatualizada, o problema n\u00e3o \u00e9 o modelo.<\/li>\n<li><strong>Rode de novo o conjunto inteiro.<\/strong> Corre\u00e7\u00e3o costuma consertar uma coisa e quebrar outra; s\u00f3 o teste completo mostra.<\/li>\n<li><strong>Guarde o resultado com data e vers\u00e3o.<\/strong> \u00c9 o que permite dizer, daqui a seis meses, se o sistema melhorou ou piorou.<\/li>\n<\/ol>\n<h2>Depois de subir<\/h2>\n<p>O conjunto-ouro n\u00e3o morre na entrada em produ\u00e7\u00e3o. Rode de novo a cada mudan\u00e7a de modelo, de instru\u00e7\u00e3o ou de base de conhecimento \u2014 e uma vez por m\u00eas mesmo sem mudan\u00e7a, porque o mundo muda em volta: pre\u00e7o novo, produto descontinuado, regra que passou a valer.<\/p>\n<p>E acrescente ao conjunto toda pergunta real que o agente errou em produ\u00e7\u00e3o. Em um ano, o conjunto vira o ativo mais valioso do projeto: a mem\u00f3ria de tudo que j\u00e1 deu errado.<\/p>\n<hr>\n<p>A DCODER entrega agente com conjunto-ouro montado a partir do hist\u00f3rico do cliente, e com o resultado registrado por vers\u00e3o. <a href=\"https:\/\/dcoder.io\/\" rel=\"noopener\">Converse com o est\u00fadio em dcoder.io<\/a>.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Cem perguntas com resposta certa conhecida, escritas antes de ligar o bot. \u00c9 o teste mais barato que existe, e \u00e9 o que separa demonstra\u00e7\u00e3o de sistema.<\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"closed","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[151],"tags":[181,41,183,179],"class_list":["post-87","post","type-post","status-publish","format-standard","hentry","category-medicao-e-evidencia","tag-agente","tag-inteligencia-artificial","tag-qualidade","tag-testes"],"_links":{"self":[{"href":"https:\/\/dcoder.io\/blog\/wp-json\/wp\/v2\/posts\/87","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/dcoder.io\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/dcoder.io\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/dcoder.io\/blog\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/dcoder.io\/blog\/wp-json\/wp\/v2\/comments?post=87"}],"version-history":[{"count":1,"href":"https:\/\/dcoder.io\/blog\/wp-json\/wp\/v2\/posts\/87\/revisions"}],"predecessor-version":[{"id":90,"href":"https:\/\/dcoder.io\/blog\/wp-json\/wp\/v2\/posts\/87\/revisions\/90"}],"wp:attachment":[{"href":"https:\/\/dcoder.io\/blog\/wp-json\/wp\/v2\/media?parent=87"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/dcoder.io\/blog\/wp-json\/wp\/v2\/categories?post=87"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/dcoder.io\/blog\/wp-json\/wp\/v2\/tags?post=87"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}