PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents
PolyWorkBench evaluates LLM agents on long-horizon, multilingual tasks across five languages, revealing critical surface areas for prompt injection, insecure tool invocation, and excessive agency.