Kimi K3 vs Claude Fable 5 on DeepSWE: Cost and Coding

In 452 DeepSWE rollouts, Claude Fable 5 leads pass@1 69.9% to 68.5%, but open-weight Kimi K3 wins pass@4 (89.4% vs 88.5%) and solves 2.8x more tasks per dollar ($4.65 vs $13.41 per rollout). Fable 5 is more reliable, solving 58 tasks four-for-four vs 45.
2 sources
Daily brief
Get tomorrow's AI brief in your inbox
More stories today
- Z.ai CEO Jie Tang: GLM 5.3 gains come from RL, not parameter count
- New tool adds 14 skills to Claude Code and Cursor for Markdown diagrams
- Tool turns Claude into a team of AI employees on your Mac
- GOP panics over Big Tech ties as Trump shifts on AI regulation
- Ethan Mollick: Claude's skill creator beats ChatGPT for reusable skills