- IA
- One Model Arena
- Modelos de decisão
- Avaliação
Qual modelo escolher? O que aprendi colocando Jev, Decisions e Clef à prova
A conclusão da primeira edição do One Model Arena: três modelos de decisão, três provas em português e uma escolha por situação.
Junior Martins · 6 min de leitura
A primeira edição do One Model Arena terminou. Coloquei três modelos de decisão nas mesmas provas, em português, com gabarito definido antes do teste. Foram 1.162 respostas em três execuções completas, sem falhas de API.
A pergunta do título tem uma resposta curta: depende da decisão. Este texto mostra por quê, com os números e com os limites de cada número.
O que foi testado
Os três modelos
Jev, Decisions e Clef não geram texto livre. Recebem contexto e uma pergunta com alternativas definidas, e devolvem uma probabilidade para cada uma. O sistema usa isso para decidir ou pedir revisão humana.
- Jev, da TypeSafe. Versão testada: jev-1.13.0. Serviço proprietário via API. Recebe texto e dados estruturados, não imagens. Por isso ficou fora da prova de imagens.
- Decisions, da OpenAI. É o nome da API; aqui ela usa o modelo gpt-6-luna. Serviço proprietário. Recebe texto e imagens.
- Clef, da Cloudflare. Modelo multimodal com 27 bilhões de parâmetros, com pesos e código publicados sob Apache 2.0. A arena usou o serviço Workers AI, não execução local.
Os três recebem o mesmo texto e as mesmas alternativas, sem gabarito e sem ver as respostas uns dos outros. O Claude Opus 5.5 apresenta e comenta às cegas, mas não disputa: os pontos vêm do gabarito e das regras.
As três provas
Maratona de reuniões. Seis reuniões fictícias com seis perguntas cada: 36 decisões por modelo, de triagem a conflito entre fontes. A regra que resolve a pergunta está escrita no contexto.
Resiliência. 298 testes por modelo em cinco baterias, cada uma com o mesmo peso na nota:
- Robustez: as 36 perguntas das reuniões reescritas com ruído, erros de digitação, alternativas invertidas ou evidência a mais.
- Português real: 60 textos com rótulo humano, 20 de cada: ASSIN 2, HateBR e B2W-Reviews01.
- Saber dizer "não": 30 pedidos fora do escopo ou com dados ausentes.
- Negação: 12 grupos com paráfrase e negação desfeita.
- Injeção e pressão: 16 casos com instruções escondidas e aprovações falsas.
Imagens. 80 fotos do CV-Bench, 20 por tarefa: contagem, posição relativa, profundidade e distância real. Só Decisions e Clef, com as mesmas imagens preparadas.
O placar
| Prova | Jev | Decisions | Clef | Vencedor pelas regras |
|---|---|---|---|---|
| Reuniões | 35/36 | 35/36 | 36/36 | Clef |
| Resiliência (0 a 100) | 87,11 | 98,11 | 97,44 | Clef, no desempate |
| Imagens | não participa | 65/80 | 69/80 | Clef |
O Clef venceu as três. Mas o placar e a escolha de uso respondem a perguntas diferentes.
Nas reuniões, os dois desvios foram estes: o Jev mandou uma validação para revisão humana, e o Decisions errou a leitura de uma proposta com 95% de confiança em "Não".
Na Resiliência, o Decisions teve a maior nota, mas a diferença de 0,67 ponto fica na faixa de empate, menor que 1 ponto. O desempate é pelo Brier, que mede a distância entre as probabilidades declaradas e o gabarito (menor é melhor): Clef 0,0116, Decisions 0,01813.
Nas imagens, a vantagem veio de uma tarefa só. Contagem, posição e profundidade empataram em 14, 18 e 19 de 20. Em distância real, o Clef fez 18/20 e o Decisions, 14/20.
O que o placar não diz
A regra de desempate escolhe um vencedor do jogo. Não responde se a amostra demonstra diferença entre os modelos. Para isso, o relatório usa bootstrap pareado com 1.000 reamostragens:
| Comparação | Intervalo de 95% | Inclui zero? |
|---|---|---|
| Resiliência · Clef − Jev | 5,11 a 16,61 pontos | Não |
| Resiliência · Clef − Decisions | −3 a 1,56 pontos | Sim |
| Imagens · Clef − Decisions | −2,5 a 12,5 pontos | Sim |
Leitura direta: na Resiliência, o Clef ficou separado do Jev nesta amostra. Entre Clef e Decisions, nas duas provas, não há superioridade demonstrada. Para as seis reuniões, esse intervalo não foi calculado, e 36 perguntas não sustentam conclusão estatística.
Pequenas diferenças não merecem grandes narrativas.
Custo e tempo
Projeção para 1 milhão de decisões semelhantes, com o tamanho médio das entradas desta edição e as tarifas de 08/10/2026, mais a mediana de resposta.
| Prova | Jev | Decisions | Clef |
|---|---|---|---|
| Reuniões | US$ 24,23 · 300 ms | US$ 37,13 · 295 ms | US$ 95,28 · 526 ms |
| Resiliência | US$ 23,29 · 265 ms | US$ 37,09 · 246 ms | US$ 94,40 · 420 ms |
| Imagens | não participa | US$ 83,01 · 328 ms | US$ 184,09 · 785 ms |
A tarifa não conta tudo. Na Resiliência, para os mesmos casos, o Jev contou 165.227 tokens de entrada e o Decisions, 110.519. Por isso comparo custo por decisão. O Jev saiu cerca de 35% abaixo do Decisions em texto.
A mediana não é tempo de raciocínio. Inclui rede, envio, leitura e validação. Em texto, Jev e Decisions ficaram a menos de 50 ms um do outro, a faixa de empate adotada pela arena. Nas imagens, o Decisions teve a menor mediana.
Muita coisa ficou fora da conta: revisão humana, infraestrutura, a assinatura mínima do Workers Paid e o Opus. Não é previsão de fatura.
Qual eu escolheria
São pontos de partida para um piloto. A escolha depende do custo do erro, da revisão humana e da tarefa real.
Triagem com regras claras e orçamento apertado: Jev, com revisão humana no fluxo. Foi o mais barato nas duas provas de texto e fez 35/36 nas reuniões. Não teve erros automáticos na Resiliência, mas encaminhou 22 de 298 respostas para revisão. A conta econômica precisa incluir esse trabalho. E zero erros observados não significa risco zero em produção.
Classificar português real e reduzir revisão: Decisions. Liderou português real com 56/60, contra 54/60 do Clef e 48/60 do Jev. Teve só 3 revisões na Resiliência inteira. Ressalva: são 20 exemplos por dataset.
Preservar decisões diante de ruído e reformulações: Clef, em um piloto de consistência. Não mudou a decisão em nenhuma das 88 comparações de forma. Jev e Decisions mudaram duas vezes cada. Mas passou em 35 de 36 grupos de robustez, e não houve controle de repetição idêntica para separar variação normal do efeito da variante.
Regras com negação, instruções citadas e pressão: Decisions pelo custo, Clef como alternativa a validar. Os dois passaram em 12/12 grupos de negação e 16/16 casos de injeção. Isso não certifica segurança: onde o erro tem consequência, mantenha validação humana.
Dizer "fora do escopo" ou "não informado": empate. Os três fizeram 30/30. Só que as alternativas já ofereciam a saída correta. O teste não prova que eles reconhecem sozinhos quando não sabem responder a uma pergunta aberta.
Imagens com prioridade em custo e rapidez: Decisions. Empatou com o Clef em três das quatro tarefas, mais barato e mais rápido. O trade-off: 65/80 contra 69/80.
Comparar distâncias entre objetos numa cena: Clef, com mais exemplos do seu domínio. Fez 18/20 contra 14/20. São só 20 fotos e o intervalo da prova completa inclui zero. A vantagem é uma hipótese de piloto.
Acerto observado acima do custo da API: Clef. 36/36 nas reuniões, vitória na Resiliência pelo Brier, 69/80 nas imagens e o menor Brier nas três provas. Custa mais, e a vantagem sobre o Decisions não teve significância estatística.
Em resumo: Jev é economia em texto. Decisions é o equilíbrio prático, com menos da metade do custo do Clef e a menor mediana nas três provas. Clef é a qualidade observada.
Os limites
- É um recorte. Tarefas específicas, em português. Não é ranking universal.
- As amostras são pequenas. 36 perguntas nas reuniões, 20 itens por dataset de português real, 20 fotos por tarefa visual.
- Os datasets são públicos. ASSIN 2, HateBR, B2W-Reviews01 e CV-Bench podem ter aparecido no treinamento dos modelos.
- Os gabaritos têm autor. Os das reuniões e dos itens escritos à mão são meus, revisados às cegas.
- Não é medição de SLA. O teste não diz que os provedores têm a mesma disponibilidade.
E há o que ficou de fora: código, escrita criativa, OCR de documentos, áudio, agentes que executam ações e decisões médicas ou jurídicas. Para isso, não há recomendação. Não extrapole.
Como usar isso
Use os resultados para reduzir a lista de candidatos. Depois rode uma amostra própria, com gabarito, custo de revisão e critérios de aceitação definidos antes de ver o resultado. Escolha o modelo para a tarefa e valide no seu domínio.
Está tudo aberto para conferir:
- Site da Arena: arena.juniormartins.dev
- Relatório completo da conclusão: arena.juniormartins.dev/relatorio
- Código: github.com/juniormartinxo/one-model-arena