Achar pelo sentido
O cofre de notas em texto aberto, o trecho que a busca guarda, o embedding como mapa de bairros, a busca por palavra, a fusão híbrida pela posição e o gabarito que decide qual busca vence.
Resumo da aula
- O que só você consegue abrir não serve a agente nenhum: uma pasta de notas em texto aberto, com fonte e data no cabeçalho, é memória de longo prazo que não depende de fornecedor.
- A busca por palavra acerta o exato, a busca por sentido acerta o parecido, e a híbrida junta as duas pela posição, às vezes perdendo o acerto que só uma viu.
- Quem decide entre elas é um gabarito com as suas perguntas e três números: recall, precisão e posição do primeiro acerto.
Neste artigo
- De onde vem o que entra na janela
- Um cofre é uma pasta
- Fonte e data no topo, e dois cuidados
- O trecho: a unidade que a busca guarda
- O embedding: um endereço num mapa de bairros
- Os limites do mapa
- A busca que lê letras
- Busca híbrida: juntar pela posição
- A fusão premia o consenso
- Medir antes de acreditar
O artigo é lido por partes. Use os botões abaixo para avançar — a aula em vídeo e o material de apoio ficam no curso, e o método completo, no livro.
Perguntas frequentes
Qual a diferença entre busca por palavra-chave e busca semântica com embeddings?
A busca por palavra, chamada lexical, procura os termos exatos e dá mais peso ao termo raro; a função mais usada é o BM25. Ela acerta códigos, siglas e números, mas não sabe que imunização e vacinação são quase a mesma coisa. A busca semântica usa embeddings, listas de números que funcionam como endereço num mapa de significados: textos de sentido parecido moram no mesmo bairro, mesmo sem palavra em comum. Ela acerta o parecido, mas borra códigos como J10 e J11 e aproxima textos que afirmam e negam a mesma coisa, porque falam do mesmo assunto. Cada uma erra num lugar diferente.
O que é busca híbrida e como funciona a Reciprocal Rank Fusion?
Busca híbrida é rodar a busca por palavra e a por sentido e juntar os resultados. Como as notas de cada uma têm escalas diferentes, somá-las seria somar metros com quilos. A Reciprocal Rank Fusion, de Cormack, Clarke e Büttcher, de 2009, ignora as notas e olha só a posição: cada lista dá a cada trecho um voto de 1 dividido por k mais a posição, e os votos se somam. O laboratório do livro usa k igual a 60 como ponto de partida. A fusão premia consenso e por isso pode enterrar o acerto que só uma das buscas viu. No teste do livro, a híbrida venceu nos três primeiros resultados e perdeu nos cinco primeiros.
Como saber qual busca funciona melhor para o meu acervo?
Medindo com um gabarito: perguntas reais em que alguém marcou à mão os documentos relevantes. Sem gabarito, a comparação vira opinião. Três métricas bastam para começar. O recall@k diz que fração dos documentos relevantes aparece entre os k primeiros, e é a mais importante para quem entrega trechos a um modelo, porque o que não é recuperado não pode ser usado. A precisão@k mede quanto lixo veio junto. O MRR mede se o certo veio no topo. A pergunta em que todas as buscas falham é a mais valiosa, porque aponta conteúdo ausente ou pergunta mal formulada, algo que nenhuma fusão resolve.
Ir direto para outra aula
- 1 A segunda onda
- 2 Do chatbot ao sistema que executa
- 3 Tudo o que não é o modelo
- 4 O contrato entre máquinas
- 5 O que a IA precisa saber
- 6 O modelo nunca aperta o botão
- 7 Achar pelo sentido
- 8 Prova com consulta
- 9 O que mora entre os documentos
- 10 A fonte vencida e o teste que sabe falhar
- 11 O agente e quem diz que ele terminou
- 12 Um processo que cabe num desenho
- 13 Peça ao modelo só o que só ele sabe
- 14 Dividir o trabalho, dividir o erro
- 15 Aprovar não é olhar
- 16 Um jeito de desfazer
- 17 Até onde o erro alcança
- 18 Quem acorda de madrugada
- 19 A fatura e o registro
- 20 Quando ninguém estiver calmo
- 21 Automação que erra igual e avisa
- 22 Todo texto pode soar como ordem
- 23 Um agente sem nome próprio
- 24 O dado que nunca precisou chegar
- 25 O sistema inteiro