FINDSum · Liquidity · dev com entrada corrigida
Leia a fonte.
Compare os resumos.
Os mesmos dez documentos nos seis braços e nos três modelos. Esta página contém os textos completos, as respostas reais e as métricas calculadas localmente.
Rodada de desenvolvimento. O full de 1.000 documentos não foi executado. Não estamos confirmando hipóteses a partir destes dez casos.
01 / Saída comparada à referência
Referência do FINDSum
A referência do alvo não entra no prompt nem na seleção dos trechos. As referências de outras empresas aparecem somente nas demonstrações few-shot.
Comparar os três modelos neste mesmo braço
02 / O que o modelo recebeu do relatório
Fonte, tabelas e contexto
Fonte disponível completa
Contexto efetivamente entregue neste braço
Como os candidatos RAG foram recuperados
Chunks de 220 palavras com sobreposição de 40. Embeddings MiniLM-L6-v2 em janelas cobrindo todo o texto. FAISS por cosseno no próprio relatório; top-12, orçamento de contexto de 3.072 tokens. A referência do alvo não participa da busca.
03 / Exemplos e chamada
Demonstrações e prompt integral
Mensagens completas: system e user, verificadas contra o payload enviado
Resposta bruta do modelo, uso e auditoria da métrica
04 / Similaridade textual
Métricas deste documento nos 18 casos
ROUGE-1/2/L e BERTScore F1. Valores maiores representam maior similaridade sob aquela métrica, não uma porcentagem de correção factual. Não há avaliação numérica ou revisão humana.
Médias dos dez documentos, por modelo e braço
05 / Execução auditável
Seleção, custos e estado
Dez documentos utilizados: IDs, empresas e origem
Plano de análise, elegibilidade e resultado operacional
Tentativas desta execução e erros, se houver
As tentativas transitórias usam retry limitado. Respostas por limite de saída são preservadas e sinalizadas; não há nova geração para melhorar o escore. O arquivo funciona offline e não chama a API ao ser aberto.