Releases: bncc-dev/bncc-benchmark
Release list
Estudo de intervenção: acesso à fonte (estudo-fonte-v0.1.0)
estudo-fonte-v0.1.0 · 25/ago/2026 · estudo de intervenção "acesso à fonte" (série própria)
A rodada grounded prometida na v0.1.0 e na v0.2.0 foi realizada e publicada
como estudo de intervenção, em série própria (DECISOES.md D14): mede o
efeito do acesso ao dado do bncc.dev, não classifica modelos. O leaderboard
não muda; esta série tem numeração independente da série vX.Y.Z.
- Rodadas:
estudo-fonte-2026-08(bateria, 24–25/ago) e
estudo-fonte-2026-08-buscar-v2(re-medição dos dois Sabiá após correção
dobncc_buscarno servidor MCP; condição distinta, apresentada ao lado da
original). Pilotopiloto-fonte-2026-08publicado para auditoria da
sequência pré-registro → piloto → bateria. - Desenho: 300 itens do
itens-v1, 1 paráfrase; 8 modelos (um por
critério fixado antes da bateria); três condições pareadas (seca, contexto,
MCP) + connector nativo em 3 modelos; pré-registro fechado antes da
primeira chamada, com cinco emendas datadas (docs/estudo-fonte/pre-registro.md). - Resultado: seca 31,9% de alucinação (elenco A agregado) → contexto 0,2%
→ MCP 2,3%; queda média de 30,6 pp por modelo, IC 95% por bootstrap por
item, em todos os 8 modelos; zero "não chamou a ferramenta" em 2.400
respostas; zero código inventado em listas. Erros residuais concentrados
nos dois Sabiá, no lookup inverso; após a correção dobncc_buscar:
Sabiá-4 4,0% → 1,0%, Sabiazinho-4 5,3% → 3,5%, falsos aceitos 0/180. - Achados devolvidos ao produto: dois defeitos do
bncc_buscar(filtro
de Computação; busca literal) corrigidos em@bncc/mcp0.3.0 / worker
0.2.2; rate limit de 60 req/min por IP documentado. - Ressalvas (por modelo, no relatório): rotas diretas (D14.1); gpt-5.6
sem raciocínio na condição A; Claude 5 e gpt-5.6 semtemperature; Kimi K3
a temperatura 1; Gemini via OpenRouter por indisponibilidade do Google;
connector do Gemini incompleto (91/300, retomada em PATCH); seca de três
modelos reaproveitada do cache de 15–18/ago; três passagens da re-medição
descartadas por defeitos do próprio cliente de medição (registradas). - Julgamento: avaliador v2 · rubrica-v1 · juiz haiku-bedrock, os mesmos
do leaderboard. Dataset dados-2026.07 (MCP em dados-2026.07.1). - Custo: US$ 61,9 de execução (bateria 59,9 + re-medição 2,0) + ~US$ 0,5
de juiz; passagens descartadas ≈ US$ 3 adicionais, fora do publicado. - Artefatos: brutos, julgados, agregados, manifestos e
estudo.jsonem
resultados/estudo-fonte-*/; relatórioestudo.htmlanexado à Release.
Página no bncc.dev prevista; até lá, a Release é o ponto de leitura. - Conflito de interesse declarado: fonte de grounding e gabarito são o
mesmo dataset, mantido pelo mesmo time.
Relatório completo: estudo.html anexado abaixo (autocontido; abra no navegador). Artefatos auditáveis em resultados/estudo-fonte-2026-08/ e resultados/estudo-fonte-2026-08-buscar-v2/.
🤖 Generated with Claude Code
v0.2.0 · elenco renovado, 19 modelos
Segunda medição de referência do benchmark.
17.100 respostas · 19 modelos · rodada oficial-seca-2026-08 (modo seco)
Coletada de 15 a 18 de agosto de 2026, por Amazon Bedrock, OpenRouter (com provedor fixado por requisição) e Maritaca direta. Todas as respostas cruas, os julgamentos e os agregados estão no repositório, uma linha por resposta — o CI recalcula os agregados a partir dos brutos a cada push e reprova qualquer divergência.
Líder GPT-5.6 Sol (nota 86,4) · lanterna Qwen 3.7 Flash (27,3).
O que mudou desde a v0.1.0
Elenco de 19. As 17 vagas de julho, sendo 7 com modelo atualizado pela empresa (Opus 4.8→5, Grok 4.5→4.6, Gemini 3.5→3.7 Flash, Kimi K2.6→K3, Qwen 3.7→3.8 Max, e os dois DeepSeek fixados em snapshots datados), mais dois entrantes: Muse Spark 1.2 (Meta) e Qwen 3.7 Flash (Alibaba).
A régua não se mexeu. Nove modelos que não trocaram de versão foram remedidos do zero, com cache novo: todos ficaram dentro de 3 pontos do resultado de julho, quatro deles dentro de 0,1. É o que dá sentido a qualquer comparação entre as duas rodadas.
Duas gerações novas saltaram ~30 pontos em um mês (Gemini Flash +29,5, Opus +29,3), enquanto o Qwen Max andou 1,3 para trás. Não há tendência única.
Três coisas que a auditoria pré-publicação encontrou
Dois modelos foram refeitos. Qwen 3.7 Plus devolveu 427 de 900 respostas vazias (47%) e Qwen 3.8 Max, 303 (34%): o teto de tokens não comportava o raciocínio, e como a resposta vem depois dele, truncar perdia tudo. Refeitos com teto maior — e as notas caíram, porque uma resposta vazia nunca aceita um código inventado. O truncamento funcionava como abstenção forçada e inflava a dimensão anti-alucinação. Números truncados são otimistas, não pessimistas.
Claude Fable 5 rodou por duas rotas (898 chamadas via Amazon Bedrock, 2 via Google), por falta de provedor fixado. As duas são irreproduzíveis: a rota majoritária passou a recusar acesso à conta no dia 18. Mantidas e declaradas, por serem 0,2% das chamadas.
O leaderboard passou a expor o provedor. Campo rotas por modelo, com o endpoint que serviu cada chamada e a contagem. A metodologia já exigia que o leaderboard identificasse o provedor (D9); o artefato exportado não carregava essa informação.
Decisões novas
D13, em três partes: o identificador designa o modelo e não a vaga no elenco (por isso kimi→kimi-k3, grok→grok-46 e outros dois renomeados, com os ids antigos preservados na v0.1.0); mudança de condição de execução vale por modelo e é declarada; e uma release publica apenas modelos com a bateria completa.
Errata da v0.1.0: o preço unitário do gpt-luna estava dez vezes acima do cobrado, inflando o custo publicado daquele modelo (~US$ 2,29 contra ~US$ 0,23 reais). Nenhuma nota, resposta ou julgamento é afetado — o campo é informativo. A v0.1.0 é imutável e não foi reescrita.
Links
- Metodologia:
METODOLOGIA.md - Composição exata, ressalvas e erratas:
RELEASES.md - Decisões numeradas:
DECISOES.md
Custo: US$ 189,47 para o resultado publicado; o desembolso total foi maior (~US$ 218), incluindo as medições descartadas dos dois Qwen.
Numeração: o projeto segue em 0.x. Esta rodada é MINOR — mesmo banco de itens (itens-v1), mesma rubrica, mesmo juiz e mesmo dataset da v0.1.0. O 1.0.0 fica para quando o protocolo estabilizar; as três lacunas que viraram a D13 mostram que ainda não é o caso.
v0.1.0 · primeira release pública
Primeira medição de referência do benchmark, publicada sem alteração na abertura do repositório.
15.300 respostas · 17 modelos · rodada oficial-seca-2026-07 (modo seco)
Coletada em 15–16 de julho de 2026, por rotas diretas de provedor, Amazon Bedrock e Fireworks. Todas as respostas cruas, os julgamentos e os agregados estão no repositório, uma linha por resposta — o CI recalcula os agregados a partir dos brutos a cada push e reprova qualquer divergência.
- Metodologia:
METODOLOGIA.md - Composição exata da release:
RELEASES.md - Origem e reuso das respostas:
resultados/README.md
Sobre a numeração: o projeto segue em 0.x. Abrir o repositório não promoveu a versão — o 1.0.0 fica reservado para quando o protocolo estabilizar (D11). Enquanto isso, o banco de itens ainda pode receber correções, e a série de comparabilidade é expectativa, não compromisso.
Sobre o snapshot: a tag aponta para o repositório como ele estava em 16/jul/2026, quando a medição foi fechada e o repositório ainda era privado — por isso o README dela ainda descreve o projeto como em construção. Os arquivos de comunidade, as licenças consolidadas e a documentação de arquitetura vieram depois e estão no main. A tag não foi movida de propósito: reposicioná-la absorveria rodadas de smoke que não fazem parte desta release.