#prime intellect
1 published article
Radhika Gaonkar's 8 October TRACE paper tests what agent scores prove
The preprint separates agent behavior from evaluator behavior, but its benchmark tests do not establish how often score failures occur in production.