DeepSeek-V4 Flash 0731 outperforms GPT-5.6 Luna in cost-efficiency

DeepSeek-V4 Flash 0731 costs $0.10 per task on DeepSWE, delivering 532 solves per $100 compared to 110 for GPT-5.6 Luna. While Luna leads in pass@1 accuracy at 67.2% versus 53.3%, a cascaded approach using both models achieves 78.9% accuracy at 37% lower cost than Luna alone.
3 sources
Daily brief
Get tomorrow's AI brief in your inbox
More stories today
- Vercel launches eve, its 'Next.js for agents' framework
- Black Hat 2026 wrap-up stresses open frameworks for agentic security
- Together AI adds educational documentation for LLM development concepts
- Auto mode launches after many months of internal use
- JPMorgan sees tech bond sales topping $500B as AI debt binge expands