← Visão geral da pipeline

FINDSum / demonstração real de ponta a ponta

Um relatório.
Seis configurações.

Este é um caso do dev, sorteado antes da geração. Mostra o funcionamento da entrada à saída. Um único documento não valida as cinco hipóteses nem substitui a avaliação com 1.000 casos.

Documento + tabelas → chunks → recuperação → exemplos → prompt → OpenRouter → resumo → ROUGE/BERTScore

A geração terminou; a auditoria da métrica revelou uma limitação. O BERTScore deste caso usou prefixos dos textos longos por causa da janela de 512 tokens. Ver contagens, textos avaliados e escores. Isso precisa ser resolvido antes do full.

01 / Dataset e preparação local

O que entrou na pipeline

Os três segmentos do mesmo relatório e as partes da referência são remontados em ordem. Os marcadores de formatação são removidos; as tabelas da tarefa são serializadas sem corrigir valores. A referência do alvo só entra na avaliação.

02 / Embeddings e recuperação

O que o RAG selecionou

MiniLM-L6-v2 codifica os trechos localmente. FAISS busca no próprio relatório por produto interno de vetores normalizados, equivalente ao cosseno. A consulta é a instrução fixa da tarefa; não é o resumo de referência.

Os candidatos abaixo são o top-k antes do orçamento. O contexto efetivamente enviado aparece na seção API. Um candidato pode ser cortado pelo limite intencional do RAG; isso é diferente de truncamento automático do prompt pelo endpoint.
Todos os chunks do relatório, antes da recuperação

03 / Banco separado de demonstrações

Quais quatro exemplos foram escolhidos

O banco possui 1.000 documentos de empresas separadas do alvo. C3 usa os quatro primeiros IDs ordenados; C4 sorteia com a semente combinada ao ID do alvo; C5 busca documentos semanticamente próximos. Cada par contém a prosa integral e a referência daquele exemplo, sem tabelas.

Oito vizinhos mais próximos do alvo no banco de exemplos

04 / Montagem, limites e geração remota

Exatamente o que foi enviado

Selecione um braço para inspecionar contexto, mensagens e payload. Temperature 0, reasoning desativado, provedor fixado e preço máximo zero. Não houve seleção da melhor resposta por escore.

Contexto do alvo
Prompt integral local
Reserva de saída

Controles verificados antes da geração

Tentativas e respostas da API, sem cabeçalhos de autenticação

05 / Respostas reais

O que cada configuração produziu

As saídas abaixo são as gerações salvas, após a limpeza padrão da pipeline. As respostas retornadas pela API estão disponíveis acima. Os resultados não foram reescritos para melhorar as métricas.

Resumo de referência do FINDSum — comparação, nunca entrada do alvo

06 / Similaridade com a referência

Quão perto os resumos ficaram

ROUGE-1/2/L F1 mede sobreposição textual. BERTScore F1 compara representações contextuais usando roberta-large, sem reescala de baseline. Escores maiores indicam mais similaridade segundo a métrica; não são porcentagens de correção factual. Não calculamos métricas numéricas, grounding ou revisão humana.

Diferenças observadas neste único caso

Deltas são descritivos. Não há p-valores, significância ou confirmação de hipóteses com este único documento.

Rastreabilidade

Reproduzir e inspecionar

Configuração, seleção e plano de análise

Página autônoma, sem chamadas à API ao abrir. A chave não faz parte dos dados exibidos ou baixados.