AI Coding Model Tier List
A capability-only view of models evaluated on Terminal Bench 2.0 with the Kilo agent harness. Every placement comes from an officially promoted KiloBench completion score; real-world usage does not affect these tiers.
Rubric
How tiers are assigned
Tier placement uses only the raw KiloBench completion score. Cost per attempt is shown on each model for context but never changes its tier. Usage and popularity are not included. Within each tier, models retain the official ranking order: completion score first, then lower attempt cost only to break equal-score ties.
- S Tier
- 70% and above completion
- A Tier
- 60% to 69.9% completion
- B Tier
- 50% to 59.9% completion
- C Tier
- Below 50% completion
Capability results
Official KiloBench tiers
S
70% and above
- GPT-6 Astra ($$$$)79.3%completion$107.29per attempt
- GPT-5.6 Sol76.2%completion$87.41per attempt
- Claude Fable 5.1 ($$$$)76.2%completion$91.41per attempt
- DeepSeek V4.1 Flash75.3%completion$2.58per attempt
- Gemini 3.8 Flash (50% off)75.3%completion$112.27per attempt
- GPT-5.574.2%completion$72.63per attempt
- Grok 4.673.0%completion$33.83per attempt
- Kimi K372.8%completion$48.38per attempt
- Claude Opus 571.5%completion$113.54per attempt
- Claude Fable 5 ($$$$)71.0%completion$87.52per attempt
- Grok 4.570.8%completion$27.29per attempt
- Claude Opus 4.770.1%completion$100.51per attempt
A
60% to 69.9%
B
50% to 59.9%
- Muse Spark 1.159.8%completion$30.15per attempt
- Claude Sonnet 559.6%completion$36.19per attempt
- Claude Sonnet 4.655.1%completion$53.37per attempt
- Qwen3.7 Max54.6%completion$20.65per attempt
- Kimi K2.654.4%completion$24.84per attempt
- Qwen3.8 Max54.2%completion$32.71per attempt
- GLM 5.253.0%completion$26.21per attempt
- Muse Spark 1.251.5%completion$44.69per attempt
- Grok Build 0.150.6%completion$30.70per attempt
- KAT-Coder-Pro V2.550.3%completion$36.16per attempt
C
Below 50%
- GLM 5.149.4%completion$23.98per attempt
- Gemini 3.6 Flash47.9%completion$80.31per attempt
- Hy3 (free)47.6%completion$0.00per attempt
- MiMo-V2.5-Pro47.6%completion$4.92per attempt
- MiniMax M347.6%completion$10.35per attempt
- kilo-auto/efficient46.7%completion$19.60per attempt
- DeepSeek V4 Pro 042344.0%completion$15.91per attempt
- Inkling43.6%completion$35.69per attempt
- Laguna S 2.1 (retires Oct 31)31.0%completion$1.85per attempt
- Ling-2.6-1T (retires Aug 24)28.1%completion$30.82per attempt
- Laguna XS 2.1 (retires Oct 31)26.7%completion$12.03per attempt
- Nemotron 3 Ultra19.1%completion$101.82per attempt
- Nemotron 3 Super (free)15.5%completion$0.00per attempt
Results are limited to evaluations explicitly promoted for publication by Kilo. See KiloBench for the full result table, costs, and methodology.