github / Research & data
jev-benchmark
AI-assisted summaries and translations. Check original sources for context and performance claims.
This repository provides a reproducible benchmark for TypeSafe AI's Jev, evaluating its performance on agent tool-call risk classification. It specifically tests accuracy, latency, and the reliability of confidence scores across clear, ambiguous, and adversarial task scenarios.
Translated summary · AI-assisted; check the original.
Source notes
This is a linked resource, not an independent verification of performance, cost or results. Check the original for current details.
- Collected
- 2026-09-21
- Discovered via
- awesomejev.com
Top 10
Sponsor
- Wallpets 91 clicks$125
W
- Walltank 107 clicks$85
W
- CChowder 59 clicks$50
- Falconer 50 clicks$45
F - Lemonpod 90 clicks$40
L
- Menta 36 clicks$35
M - Sway 34 clicks$30
S
- Peon-Ping 30 clicks$25
P - Zeron 92 clicks$20
Z
- Guideless 25 clicks$15
G