FINDSum / demonstração real de ponta a ponta
Um relatório.
Seis configurações.
Documento + tabelas → chunks → recuperação → exemplos → prompt → OpenRouter → resumo → ROUGE/BERTScore
01 / Dataset e preparação local
O que entrou na pipeline
Os três segmentos do mesmo relatório e as partes da referência são remontados em ordem. Os marcadores de formatação são removidos; as tabelas da tarefa são serializadas sem corrigir valores. A referência do alvo só entra na avaliação.
02 / Embeddings e recuperação
O que o RAG selecionou
MiniLM-L6-v2 codifica os trechos localmente. FAISS busca no próprio relatório por produto interno de vetores normalizados, equivalente ao cosseno. A consulta é a instrução fixa da tarefa; não é o resumo de referência.
Todos os chunks do relatório, antes da recuperação
03 / Banco separado de demonstrações
Quais quatro exemplos foram escolhidos
O banco possui 1.000 documentos de empresas separadas do alvo. C3 usa os quatro primeiros IDs ordenados; C4 sorteia com a semente combinada ao ID do alvo; C5 busca documentos semanticamente próximos. Cada par contém a prosa integral e a referência daquele exemplo, sem tabelas.
Oito vizinhos mais próximos do alvo no banco de exemplos
04 / Montagem, limites e geração remota
Exatamente o que foi enviado
Selecione um braço para inspecionar contexto, mensagens e payload. Temperature 0, reasoning desativado, provedor fixado e preço máximo zero. Não houve seleção da melhor resposta por escore.
Controles verificados antes da geração
Tentativas e respostas da API, sem cabeçalhos de autenticação
05 / Respostas reais
O que cada configuração produziu
As saídas abaixo são as gerações salvas, após a limpeza padrão da pipeline. As respostas retornadas pela API estão disponíveis acima. Os resultados não foram reescritos para melhorar as métricas.
Resumo de referência do FINDSum — comparação, nunca entrada do alvo
06 / Similaridade com a referência
Quão perto os resumos ficaram
ROUGE-1/2/L F1 mede sobreposição textual. BERTScore F1 compara representações contextuais usando roberta-large, sem reescala de baseline. Escores maiores indicam mais similaridade segundo a métrica; não são porcentagens de correção factual. Não calculamos métricas numéricas, grounding ou revisão humana.
Diferenças observadas neste único caso
Deltas são descritivos. Não há p-valores, significância ou confirmação de hipóteses com este único documento.
Rastreabilidade
Reproduzir e inspecionar
Configuração, seleção e plano de análise
Página autônoma, sem chamadas à API ao abrir. A chave não faz parte dos dados exibidos ou baixados.