← Pipeline e desenho do experimento

FINDSum · Liquidity · dev com entrada corrigida

Leia a fonte.
Compare os resumos.

Os mesmos dez documentos nos seis braços e nos três modelos. Esta página contém os textos completos, as respostas reais e as métricas calculadas localmente.

A instrução de até 750 palavras foi mantida. ROUGE usa o texto completo; BERTScore agora usa XLNet-base-cased, com auditoria dos tokens e sem corte em 512. Os escores não são diretamente comparáveis aos BERTScores anteriores com RoBERTa.

Rodada de desenvolvimento. O full de 1.000 documentos não foi executado. Não estamos confirmando hipóteses a partir destes dez casos.

01 / Saída comparada à referência

Referência do FINDSum

A referência do alvo não entra no prompt nem na seleção dos trechos. As referências de outras empresas aparecem somente nas demonstrações few-shot.

Comparar os três modelos neste mesmo braço

02 / O que o modelo recebeu do relatório

Fonte, tabelas e contexto

Fonte disponível completa

Contexto efetivamente entregue neste braço

Como os candidatos RAG foram recuperados

Chunks de 220 palavras com sobreposição de 40. Embeddings MiniLM-L6-v2 em janelas cobrindo todo o texto. FAISS por cosseno no próprio relatório; top-12, orçamento de contexto de 3.072 tokens. A referência do alvo não participa da busca.

03 / Exemplos e chamada

Demonstrações e prompt integral

Mensagens completas: system e user, verificadas contra o payload enviado
Resposta bruta do modelo, uso e auditoria da métrica

04 / Similaridade textual

Métricas deste documento nos 18 casos

ROUGE-1/2/L e BERTScore F1. Valores maiores representam maior similaridade sob aquela métrica, não uma porcentagem de correção factual. Não há avaliação numérica ou revisão humana.

Médias dos dez documentos, por modelo e braço

05 / Execução auditável

Seleção, custos e estado

Dez documentos utilizados: IDs, empresas e origem
Plano de análise, elegibilidade e resultado operacional
Tentativas desta execução e erros, se houver

As tentativas transitórias usam retry limitado. Respostas por limite de saída são preservadas e sinalizadas; não há nova geração para melhorar o escore. O arquivo funciona offline e não chama a API ao ser aberto.