Luiz Maibashi Economista · construo e meço sistemas de IA

Projetos

busca semântica · medição Em andamento set 2026, em andamento

Medir o que de fato melhora uma busca por significado

Toda mudança numa busca por significado parece melhorar alguma coisa quando você testa em três perguntas escolhidas a dedo. Este é o banco de provas que responde, com número e margem de erro, se a mudança melhorou de verdade ou se o ganho é menor que a incerteza da própria medição.

Palavras sublinhadas têm uma explicação rápida. Toque nelas.

previsão antes da medição
escrito antes de rodar 0,57 o que eu previ medido depois 0,38 o que deu de verdade Errei por 0,19, e é esse erro que fica registrado o acerto não ensina nada: ele só confirma o que já se pensava
A previsão escrita antes é o que separa medir de justificar. Depois do número na tela, qualquer resultado parece o esperado, e aí a medição deixa de corrigir alguma coisa.
O QUÊ

Um conjunto de testes que responde se uma mudança na busca (o modelo de vetores, o tamanho dos pedaços de texto, um reordenador no fim) melhora de verdade ou é só flutuação da amostra.

POR QUÊ

Trocar uma peça do sistema por um ganho que é ruído é esforço jogado fora, e pior: cria a impressão de que houve progresso. O teste compara pares (trechos do mesmo arquivo contra trechos aleatórios) e usa uma medida que não depende de escala, então dá para comparar configurações diferentes na mesma régua.

COMO

O contraste é medido com reamostragem (bootstrap) para ter a margem de erro, e não só o número central. Toda medição vem depois de uma previsão escrita do resultado, porque previsão feita depois do número não é previsão, é justificativa.

RESULTADO

Primeiro resultado: o modelo de busca multilíngue supera o de só inglês por 0,043, com margem que não cruza o zero. Antes de medir, eu previ 0,57 para outra métrica e o valor real foi 0,38. Errei feio, e o erro de previsão virou o aprendizado registrado.

0 + 4,3
LEITURA

Está aqui em andamento de propósito, porque o que interessa mostrar é o desenho da medição, não a conclusão. Antes de rodar, eu escrevi que esperava 0,57 numa das métricas. Deu 0,38. Errei por uma margem grande, e é esse erro que virou o registro: previsão escrita antes é o que impede a medição de virar confirmação do que eu já achava.

PRÓXIMO PASSO

Montar um gabarito de 20 perguntas com a resposta certa conhecida, e medir quantas aparecem entre os primeiros resultados da busca (recall@k). Depois testar uma reordenação por cross-encoder e comparar o ganho de qualidade contra o custo extra de tempo. Cada mudança entra com previsão escrita antes e margem de erro depois.