Avaliação Psicométrica e Calibração de Decisão
Primeiro benchmark público avaliando o modelo Jev (TypeSafe AI) em exames padronizados brasileiros. Investigamos acurácia por área do ENEM, Expected Calibration Error (ECE), Brier Score e latência ultrabaixa em contraste com modelos generativos tradicionais.
Desempenho por Área do Conhecimento
Comparativo de retenção conceitual entre Linguagens, Humanas, Natureza e Matemática.
Diagrama de Calibração (Confiança vs Acurácia)
Mede o quanto a certeza expressa pelo modelo reflete a taxa empírica de acerto (RLCD).
Consistência Intra-Modelo e Dinâmica do Escape (INVALIDO)
Comparativo direto item a item entre a rodada com rota de fuga e a rodada com decisão estritamente forçada (A–E).
Em 84 de 86 questões onde não houve abstenção no teste 1, o Jev repetiu exatamente a mesma alternativa no teste 2.
Acertos nos itens que o modelo aceitou responder (78.8%) versus nos itens que ele havia rejeitado como inválidos (35.5%).
Mesmo nas questões de maior incerteza (rejeitadas), ao ser forçado a palpitar, o Jev superou o chute aleatório (20%).
- Q11 (Linguagens): Com escape indicou
A(conf=0.45); sem escape corrigiu paraB(conf=0.42) — Gabarito oficial: B (Acerto na 2ª rodada). - Q46 (Humanas): Com escape indicou
E(conf=0.52); sem escape oscilou paraB(conf=0.31) — Gabarito oficial: E.
Matriz Experimental: System One vs LLMs Generativas
Comparação metodológica entre o paradigma decisório do Jev e baselines autorregressivos abertos.
| Nó Experimental | Arquitetura | Mecanismo de Resposta | Latência Média | Calibração (ECE) |
|---|---|---|---|---|
| Jev 1.13 (Sem Escape / Forçado A–E) | System One (Discriminativo) | Choice nativo (A–E forçado) | ~698 ms | 0.078 (Altamente Calibrado) |
| Jev 1.13 (Com Escape INVALIDO) | System One (Discriminativo) | Choice nativo + Opção Escape | ~696 ms | 0.275 (Abstenção 50.8%) |
| NVIDIA Nemotron 3 Super 120B | Autoregressivo (120B MoE) | Prompt Zero-shot + JSON forçado | p50: 531 ms | RTT Médio: 9.7s* | 0.235 (Superconfiante) |
| NVIDIA Nemotron 3.5 Lightning | Autoregressivo (MoE) | Prompt Zero-shot + JSON forçado | p50: 613 ms | RTT Médio: 46.3s* | 0.228 (Superconfiante) |
* Nota metodológica: O tempo de inferência local/p50 das LLMs é da ordem de 500–600 ms, porém o RTT médio reflete enfileiramento e rate-limiting do tier gratuito da OpenRouter, não devendo ser comparado a instâncias dedicadas.