L'essentiel: Jev, le modèle de décision de TypeSafe, atteint 84,0 % de précision comme juge sur RM-Bench, contre 87,6 % pour Gemini 3.8 Flash. Seul, il est donc moins bon. Sa confiance étant calibrée, on peut n'escalader vers le LLM que les 24 % de jugements incertains : 88,0 % de précision pour 38 % du coût et cinq fois moins de temps. Mesuré sur 4 500 jugements par configuration.
TypeSafe AI a lancé Jev le 15 septembre 2026. Le modèle ne génère pas de texte : il renvoie une décision typée assortie d'une probabilité calibrée, en une seule passe. Nous avons voulu savoir s'il pouvait remplacer un LLM-as-a-judge, la méthode standard pour évaluer un agent IA à grande échelle. Une suite d'évaluation est rejouée à chaque déploiement, et chaque rejeu refait les mêmes milliers de jugements, ce qui rend le prix unitaire du juge déterminant.
Voici les chiffres bruts, y compris les endroits où la mesure nous a contredits.
Jev expose trois types de réponse, et ils correspondent exactement aux trois manières standard de faire juger un modèle.
1. Choice sélectionne une option parmi un ensemble défini, ce qui couvre la comparaison par paires : A ou B. 2. Score note sur une échelle ordonnée, ce qui couvre la notation de type Likert de 1 à 5. 3. Noul répond par oui ou non avec une probabilité, ce qui couvre le verdict binaire du type « cette réponse est-elle fidèle au contexte ? ».
La tâche reste donc la même dans les deux cas, seul le moteur change.
Jev ne facture que les tokens en entrée, à un tarif environ 18 fois inférieur à celui de Gemini 3.8 Flash. Gemini facture l'entrée et la sortie, la sortie cinq fois plus cher que l'entrée, et les tokens de raisonnement sont comptés au tarif de sortie. Sur une tâche où la réponse utile tient en un caractère, ce dernier point pèse lourd.
Nous avons commencé par RewardBench v1. Jev y obtient 99,0 %. Ce résultat ne mesure rien : le benchmark est saturé, ce qui est précisément la raison pour laquelle l'Allen Institute a publié RewardBench 2.
Nous sommes passés à RM-Bench, conçu pour isoler le biais de style. Chaque question du jeu porte trois bonnes réponses et trois mauvaises, à trois niveaux de mise en forme croissants : brut, détaillé, puis détaillé avec balisage Markdown. La matrice 3 × 3 se découpe en trois régimes.
- Facile : la bonne réponse est aussi la mieux présentée. - Normal : les deux réponses ont le même niveau de mise en forme. - Difficile : la mauvaise réponse est la mieux présentée.
L'écart entre le régime facile et le régime difficile mesure directement à quel point un juge se laisse acheter par la mise en forme.
Nous avons échantillonné 250 questions sur les 1 327 du jeu, réparties également entre cinq domaines : conversation, code, mathématiques, refus de sécurité et réponse de sécurité. Les 250 questions produisent 2 250 comparaisons, chacune jugée dans les deux sens (A/B puis B/A) pour exposer le biais de position. Cela fait 4 500 jugements par configuration.