System One

Jev no ENEM 2025

Avaliação Psicométrica e Calibração de Decisão

Primeiro benchmark público avaliando o modelo Jev (TypeSafe AI) em exames padronizados brasileiros. Investigamos acurácia por área do ENEM, Expected Calibration Error (ECE), Brier Score e latência ultrabaixa em contraste com modelos generativos tradicionais.

Amostra Avaliada
185 itens (D1 + D2)
ENEM 2025 homologado
Acurácia Efetiva
78.7% (70/89 acertos)
Quando tomou decisão firme (A–E)
Abstenção / Escape
50.8% (86.7% em Matemática)
Mitigação de erro via INVALIDO
Latência Mediana (p50)
696 ms / item
Processamento de estado direto

Desempenho por Área do Conhecimento

Comparativo de retenção conceitual entre Linguagens, Humanas, Natureza e Matemática.

Diagrama de Calibração (Confiança vs Acurácia)

Mede o quanto a certeza expressa pelo modelo reflete a taxa empírica de acerto (RLCD).

Estabilidade Preditiva

Consistência Intra-Modelo e Dinâmica do Escape (INVALIDO)

Comparativo direto item a item entre a rodada com rota de fuga e a rodada com decisão estritamente forçada (A–E).

Concordância Exata
97.7%

Em 84 de 86 questões onde não houve abstenção no teste 1, o Jev repetiu exatamente a mesma alternativa no teste 2.

Filtro de Risco Eficiente
78.8% vs 35.5%

Acertos nos itens que o modelo aceitou responder (78.8%) versus nos itens que ele havia rejeitado como inválidos (35.5%).

Superação do Chute
35.5% > 20%

Mesmo nas questões de maior incerteza (rejeitadas), ao ser forçado a palpitar, o Jev superou o chute aleatório (20%).

Divergências Detectadas (apenas 2 em 86 itens):
  • Q11 (Linguagens): Com escape indicou A (conf=0.45); sem escape corrigiu para B (conf=0.42) — Gabarito oficial: B (Acerto na 2ª rodada).
  • Q46 (Humanas): Com escape indicou E (conf=0.52); sem escape oscilou para B (conf=0.31) — Gabarito oficial: E.

Matriz Experimental: System One vs LLMs Generativas

Comparação metodológica entre o paradigma decisório do Jev e baselines autorregressivos abertos.

Nó Experimental Arquitetura Mecanismo de Resposta Latência Média Calibração (ECE)
Jev 1.13 (Sem Escape / Forçado A–E) System One (Discriminativo) Choice nativo (A–E forçado) ~698 ms 0.078 (Altamente Calibrado)
Jev 1.13 (Com Escape INVALIDO) System One (Discriminativo) Choice nativo + Opção Escape ~696 ms 0.275 (Abstenção 50.8%)
NVIDIA Nemotron 3 Super 120B Autoregressivo (120B MoE) Prompt Zero-shot + JSON forçado p50: 531 ms | RTT Médio: 9.7s* 0.235 (Superconfiante)
NVIDIA Nemotron 3.5 Lightning Autoregressivo (MoE) Prompt Zero-shot + JSON forçado p50: 613 ms | RTT Médio: 46.3s* 0.228 (Superconfiante)

* Nota metodológica: O tempo de inferência local/p50 das LLMs é da ordem de 500–600 ms, porém o RTT médio reflete enfileiramento e rate-limiting do tier gratuito da OpenRouter, não devendo ser comparado a instâncias dedicadas.