Skip to content

Releases: bncc-dev/bncc-benchmark

Estudo de intervenção: acesso à fonte (estudo-fonte-v0.1.0)

Choose a tag to compare

@marcosbeto marcosbeto released this 26 Aug 01:22
ead7fdd

estudo-fonte-v0.1.0 · 25/ago/2026 · estudo de intervenção "acesso à fonte" (série própria)

A rodada grounded prometida na v0.1.0 e na v0.2.0 foi realizada e publicada
como estudo de intervenção, em série própria (DECISOES.md D14): mede o
efeito do acesso ao dado do bncc.dev, não classifica modelos. O leaderboard
não muda; esta série tem numeração independente da série vX.Y.Z.

  • Rodadas: estudo-fonte-2026-08 (bateria, 24–25/ago) e
    estudo-fonte-2026-08-buscar-v2 (re-medição dos dois Sabiá após correção
    do bncc_buscar no servidor MCP; condição distinta, apresentada ao lado da
    original). Piloto piloto-fonte-2026-08 publicado para auditoria da
    sequência pré-registro → piloto → bateria.
  • Desenho: 300 itens do itens-v1, 1 paráfrase; 8 modelos (um por
    critério fixado antes da bateria); três condições pareadas (seca, contexto,
    MCP) + connector nativo em 3 modelos; pré-registro fechado antes da
    primeira chamada, com cinco emendas datadas (docs/estudo-fonte/pre-registro.md).
  • Resultado: seca 31,9% de alucinação (elenco A agregado) → contexto 0,2%
    → MCP 2,3%; queda média de 30,6 pp por modelo, IC 95% por bootstrap por
    item, em todos os 8 modelos; zero "não chamou a ferramenta" em 2.400
    respostas; zero código inventado em listas. Erros residuais concentrados
    nos dois Sabiá, no lookup inverso; após a correção do bncc_buscar:
    Sabiá-4 4,0% → 1,0%, Sabiazinho-4 5,3% → 3,5%, falsos aceitos 0/180.
  • Achados devolvidos ao produto: dois defeitos do bncc_buscar (filtro
    de Computação; busca literal) corrigidos em @bncc/mcp 0.3.0 / worker
    0.2.2; rate limit de 60 req/min por IP documentado.
  • Ressalvas (por modelo, no relatório): rotas diretas (D14.1); gpt-5.6
    sem raciocínio na condição A; Claude 5 e gpt-5.6 sem temperature; Kimi K3
    a temperatura 1; Gemini via OpenRouter por indisponibilidade do Google;
    connector do Gemini incompleto (91/300, retomada em PATCH); seca de três
    modelos reaproveitada do cache de 15–18/ago; três passagens da re-medição
    descartadas por defeitos do próprio cliente de medição (registradas).
  • Julgamento: avaliador v2 · rubrica-v1 · juiz haiku-bedrock, os mesmos
    do leaderboard. Dataset dados-2026.07 (MCP em dados-2026.07.1).
  • Custo: US$ 61,9 de execução (bateria 59,9 + re-medição 2,0) + ~US$ 0,5
    de juiz; passagens descartadas ≈ US$ 3 adicionais, fora do publicado.
  • Artefatos: brutos, julgados, agregados, manifestos e estudo.json em
    resultados/estudo-fonte-*/; relatório estudo.html anexado à Release.
    Página no bncc.dev prevista; até lá, a Release é o ponto de leitura.
  • Conflito de interesse declarado: fonte de grounding e gabarito são o
    mesmo dataset, mantido pelo mesmo time.

Relatório completo: estudo.html anexado abaixo (autocontido; abra no navegador). Artefatos auditáveis em resultados/estudo-fonte-2026-08/ e resultados/estudo-fonte-2026-08-buscar-v2/.

🤖 Generated with Claude Code

https://claude.ai/code/session_01LtfqgC8xbnRF55aT6v3CKR

v0.2.0 · elenco renovado, 19 modelos

Choose a tag to compare

@marcosbeto marcosbeto released this 18 Aug 14:26
dafebbc

Segunda medição de referência do benchmark.

17.100 respostas · 19 modelos · rodada oficial-seca-2026-08 (modo seco)

Coletada de 15 a 18 de agosto de 2026, por Amazon Bedrock, OpenRouter (com provedor fixado por requisição) e Maritaca direta. Todas as respostas cruas, os julgamentos e os agregados estão no repositório, uma linha por resposta — o CI recalcula os agregados a partir dos brutos a cada push e reprova qualquer divergência.

Líder GPT-5.6 Sol (nota 86,4) · lanterna Qwen 3.7 Flash (27,3).

O que mudou desde a v0.1.0

Elenco de 19. As 17 vagas de julho, sendo 7 com modelo atualizado pela empresa (Opus 4.8→5, Grok 4.5→4.6, Gemini 3.5→3.7 Flash, Kimi K2.6→K3, Qwen 3.7→3.8 Max, e os dois DeepSeek fixados em snapshots datados), mais dois entrantes: Muse Spark 1.2 (Meta) e Qwen 3.7 Flash (Alibaba).

A régua não se mexeu. Nove modelos que não trocaram de versão foram remedidos do zero, com cache novo: todos ficaram dentro de 3 pontos do resultado de julho, quatro deles dentro de 0,1. É o que dá sentido a qualquer comparação entre as duas rodadas.

Duas gerações novas saltaram ~30 pontos em um mês (Gemini Flash +29,5, Opus +29,3), enquanto o Qwen Max andou 1,3 para trás. Não há tendência única.

Três coisas que a auditoria pré-publicação encontrou

Dois modelos foram refeitos. Qwen 3.7 Plus devolveu 427 de 900 respostas vazias (47%) e Qwen 3.8 Max, 303 (34%): o teto de tokens não comportava o raciocínio, e como a resposta vem depois dele, truncar perdia tudo. Refeitos com teto maior — e as notas caíram, porque uma resposta vazia nunca aceita um código inventado. O truncamento funcionava como abstenção forçada e inflava a dimensão anti-alucinação. Números truncados são otimistas, não pessimistas.

Claude Fable 5 rodou por duas rotas (898 chamadas via Amazon Bedrock, 2 via Google), por falta de provedor fixado. As duas são irreproduzíveis: a rota majoritária passou a recusar acesso à conta no dia 18. Mantidas e declaradas, por serem 0,2% das chamadas.

O leaderboard passou a expor o provedor. Campo rotas por modelo, com o endpoint que serviu cada chamada e a contagem. A metodologia já exigia que o leaderboard identificasse o provedor (D9); o artefato exportado não carregava essa informação.

Decisões novas

D13, em três partes: o identificador designa o modelo e não a vaga no elenco (por isso kimikimi-k3, grokgrok-46 e outros dois renomeados, com os ids antigos preservados na v0.1.0); mudança de condição de execução vale por modelo e é declarada; e uma release publica apenas modelos com a bateria completa.

Errata da v0.1.0: o preço unitário do gpt-luna estava dez vezes acima do cobrado, inflando o custo publicado daquele modelo (~US$ 2,29 contra ~US$ 0,23 reais). Nenhuma nota, resposta ou julgamento é afetado — o campo é informativo. A v0.1.0 é imutável e não foi reescrita.

Links

Custo: US$ 189,47 para o resultado publicado; o desembolso total foi maior (~US$ 218), incluindo as medições descartadas dos dois Qwen.

Numeração: o projeto segue em 0.x. Esta rodada é MINOR — mesmo banco de itens (itens-v1), mesma rubrica, mesmo juiz e mesmo dataset da v0.1.0. O 1.0.0 fica para quando o protocolo estabilizar; as três lacunas que viraram a D13 mostram que ainda não é o caso.

v0.1.0 · primeira release pública

Choose a tag to compare

@marcosbeto marcosbeto released this 27 Jul 04:24

Primeira medição de referência do benchmark, publicada sem alteração na abertura do repositório.

15.300 respostas · 17 modelos · rodada oficial-seca-2026-07 (modo seco)

Coletada em 15–16 de julho de 2026, por rotas diretas de provedor, Amazon Bedrock e Fireworks. Todas as respostas cruas, os julgamentos e os agregados estão no repositório, uma linha por resposta — o CI recalcula os agregados a partir dos brutos a cada push e reprova qualquer divergência.

Sobre a numeração: o projeto segue em 0.x. Abrir o repositório não promoveu a versão — o 1.0.0 fica reservado para quando o protocolo estabilizar (D11). Enquanto isso, o banco de itens ainda pode receber correções, e a série de comparabilidade é expectativa, não compromisso.

Sobre o snapshot: a tag aponta para o repositório como ele estava em 16/jul/2026, quando a medição foi fechada e o repositório ainda era privado — por isso o README dela ainda descreve o projeto como em construção. Os arquivos de comunidade, as licenças consolidadas e a documentação de arquitetura vieram depois e estão no main. A tag não foi movida de propósito: reposicioná-la absorveria rodadas de smoke que não fazem parte desta release.