Skip to content

v0.2.0 · elenco renovado, 19 modelos

Latest

Choose a tag to compare

@marcosbeto marcosbeto released this 18 Aug 14:26
· 5 commits to main since this release
dafebbc

Segunda medição de referência do benchmark.

17.100 respostas · 19 modelos · rodada oficial-seca-2026-08 (modo seco)

Coletada de 15 a 18 de agosto de 2026, por Amazon Bedrock, OpenRouter (com provedor fixado por requisição) e Maritaca direta. Todas as respostas cruas, os julgamentos e os agregados estão no repositório, uma linha por resposta — o CI recalcula os agregados a partir dos brutos a cada push e reprova qualquer divergência.

Líder GPT-5.6 Sol (nota 86,4) · lanterna Qwen 3.7 Flash (27,3).

O que mudou desde a v0.1.0

Elenco de 19. As 17 vagas de julho, sendo 7 com modelo atualizado pela empresa (Opus 4.8→5, Grok 4.5→4.6, Gemini 3.5→3.7 Flash, Kimi K2.6→K3, Qwen 3.7→3.8 Max, e os dois DeepSeek fixados em snapshots datados), mais dois entrantes: Muse Spark 1.2 (Meta) e Qwen 3.7 Flash (Alibaba).

A régua não se mexeu. Nove modelos que não trocaram de versão foram remedidos do zero, com cache novo: todos ficaram dentro de 3 pontos do resultado de julho, quatro deles dentro de 0,1. É o que dá sentido a qualquer comparação entre as duas rodadas.

Duas gerações novas saltaram ~30 pontos em um mês (Gemini Flash +29,5, Opus +29,3), enquanto o Qwen Max andou 1,3 para trás. Não há tendência única.

Três coisas que a auditoria pré-publicação encontrou

Dois modelos foram refeitos. Qwen 3.7 Plus devolveu 427 de 900 respostas vazias (47%) e Qwen 3.8 Max, 303 (34%): o teto de tokens não comportava o raciocínio, e como a resposta vem depois dele, truncar perdia tudo. Refeitos com teto maior — e as notas caíram, porque uma resposta vazia nunca aceita um código inventado. O truncamento funcionava como abstenção forçada e inflava a dimensão anti-alucinação. Números truncados são otimistas, não pessimistas.

Claude Fable 5 rodou por duas rotas (898 chamadas via Amazon Bedrock, 2 via Google), por falta de provedor fixado. As duas são irreproduzíveis: a rota majoritária passou a recusar acesso à conta no dia 18. Mantidas e declaradas, por serem 0,2% das chamadas.

O leaderboard passou a expor o provedor. Campo rotas por modelo, com o endpoint que serviu cada chamada e a contagem. A metodologia já exigia que o leaderboard identificasse o provedor (D9); o artefato exportado não carregava essa informação.

Decisões novas

D13, em três partes: o identificador designa o modelo e não a vaga no elenco (por isso kimikimi-k3, grokgrok-46 e outros dois renomeados, com os ids antigos preservados na v0.1.0); mudança de condição de execução vale por modelo e é declarada; e uma release publica apenas modelos com a bateria completa.

Errata da v0.1.0: o preço unitário do gpt-luna estava dez vezes acima do cobrado, inflando o custo publicado daquele modelo (~US$ 2,29 contra ~US$ 0,23 reais). Nenhuma nota, resposta ou julgamento é afetado — o campo é informativo. A v0.1.0 é imutável e não foi reescrita.

Links

Custo: US$ 189,47 para o resultado publicado; o desembolso total foi maior (~US$ 218), incluindo as medições descartadas dos dois Qwen.

Numeração: o projeto segue em 0.x. Esta rodada é MINOR — mesmo banco de itens (itens-v1), mesma rubrica, mesmo juiz e mesmo dataset da v0.1.0. O 1.0.0 fica para quando o protocolo estabilizar; as três lacunas que viraram a D13 mostram que ainda não é o caso.