人工智能辅助软件工程领域涌现出多个用于衡量大语言模型(LLM)能力的基准测试。Android 开发者面临着现有基准测试未涵盖的特定挑战,因此我们创建了一个专注于高质量 Android 开发这一核心目标的基准测试。
模型 得分 (%) info 每个模型在 10 次运行中成功解决 100 个测试用例的平均百分比
arrow_range 置信区间 (%) info 预期性能范围,反映结果的统计可靠性 (p值 < 0.05)
平均延迟 (小时) info 在 10 次运行中解决 100 个任务所需的平均时间
平均总 Token 数 (百万) info 在 10 次运行中,完成一轮完整基准测试(100 个任务)的平均 Token 消耗量
平均成本 ($) info 完成一轮完整基准测试的平均成本
日期
GPT 5.5 74.0
66.9 — 80.6 15.7 64.7 $134.2 2026-04-28
GPT 5.4 72.4
65.4 — 79.0 21.2 64.2 $91.7 2026-03-16
Gemini 3.1 Pro Preview 72.4
65.2 — 79.0 11.1 73.3 $47.9 2026-02-28
Claude Opus 4.7 68.7
61.0 — 76.0 11.6 90.0 $124.3 2026-04-27
Claude Opus 4.6 66.6
59.2 — 74.0 9.9 69.5 $84.4 2026-02-26
Gemini 3.5 Flash 63.7
56.3 — 70.7 14.2 355.9 $147.1 2026-05-20
GLM 5.1 59.7
52.1 — 67.4 33.4 80.2 $46.7 2026-05-08
Kimi K2.6 58.6
51.3 — 66.1 29.9 94.3 $42.5 2026-05-10
Claude Sonnet 4.6 58.4
50.3 — 66.3 8.2 47.9 $40.4 2026-03-01
DeepSeek V4 Pro 55.4
47.9 — 63.5 35.8 132.7 $13.7 2026-05-08
Claude Sonnet 4.5 53.7
46.1 — 61.4 13.1 94.2 $61.0 2026-02-26
DeepSeek V4 Flash 52.7
45.1 — 60.2 28.1 164.7 $8.4 2026-05-11
MiMo 2.5 Pro 52.0
43.6 — 59.4 33.1 97.5 $74.5 2026-05-09
Qwen 3.6 Max Preview 51.4
44.1 — 59.2 20.5 103.0 $222.4 2026-05-07
Gemini 3 Flash Preview 42.0
36.2 — 48.2 16.5 148.0 $34.2 2026-02-26
Qwen 3.6 27B 37.4
30.3 — 44.7 20.7 112.3 $64.6 2026-05-05
MiniMax M2.7 37.2
30.2 — 44.3 20.3 128.3 $10.1 2026-05-01
Gemma 4 31B IT 33.2
26.0 — 40.8 14.2 29.5 $2.5 2026-05-01
Qwen 3.6 35B A3B 31.7
24.7 — 39.0 12.5 113.4 $10.7 2026-05-05
Gemma 4 26B A4B IT 25.1
18.6 — 31.8 21.4 77.2 $3.3 2026-05-01
GPT OSS 120B 18.9
13.3 — 24.7 25.9 122.7 $7.6 2026-05-09
Qwen 3.5 9B 15.5
10.4 — 21.1 16.6 181.4 $15.6 2026-05-07
GPT OSS 20B 2.4
1.1 — 3.8 3.8 12.0 $0.2 2026-05-11
截至 2026 年 6 月 9 日的最新结果: 本次更新添加了 Gemini 3.5 Flash,并将旧版本模型(GPT 5.3 Codex、GPT 5.2 Codex、Claude Opus 4.6、Claude Opus 4.5、Gemini 3 Pro Preview、Gemini 2.5 Pro 和 Gemini 2.5 Flash)移至我们的新归档页面,您可以在该页面找到以往版本的排行榜。

了解有关 Android 基准测试的更多信息

深入了解我们如何创建一套通用的 Android 开发者任务。
许多任务基于我们对高质量 Android 开发的定义,详情请参阅我们的开发者文档。
查看完整仓库,以便您可以亲自复现这些测试。