github / Research & data
jev-benchmark
요약·번역에 AI를 활용합니다. 원문과 성능 주장은 출처에서 확인하세요.
이 저장소는 TypeSafe AI의 Jev를 위한 재현 가능한 벤치마크를 제공하며, 에이전트 도구 호출 위험 분류 성능을 평가합니다. 명확하거나 모호한, 혹은 적대적인 작업 시나리오 전반에 걸쳐 정확도, 지연 시간 및 신뢰도 점수의 신뢰성을 테스트합니다.
번역된 요약 · AI-assisted; check the original.
상위 10
Sponsor
- Wallpets 94 클릭$125
W
- Walltank 109 클릭$85
W
- CChowder 61 클릭$50
- Falconer 52 클릭$45
F - Lemonpod 92 클릭$40
L
- Menta 38 클릭$35
M - Sway 36 클릭$30
S
- Peon-Ping 32 클릭$25
P - Zeron 94 클릭$20
Z
- Guideless 27 클릭$15
G