Homus

Organizations / Abundant AI

Abundant AI

RL environment và benchmark cho coding agent. · 1 talks

SWE-Marathon: Evaluating Coding Agents at Billion-Token Scale

Rishi Desai · Abundant AI · 13 min

Benchmark 20 task cỡ project cho coding agent: agent tốt nhất chỉ đạt 26%, và vì sao verifier đa kênh, CUA, anti-cheat là nút thắt thật.