
Eleven Voice Agents, One Bank Call, No Clean Winner
An arXiv benchmark of eleven production voice-agent stacks ran 3,300 simulated calls against a real database. The researchers found task completion collapses on complicated calls, per-call cost varies thirteenfold with no link to quality, and a verification leak hides inside correct refusals.
August 1, 2026 · 13 min read