Android Bench
人工智能辅助软件工程领域涌现出多个用于衡量大语言模型(LLM)能力的基准测试。Android 开发者面临着现有基准测试未涵盖的特定挑战,因此我们创建了一个专注于高质量 Android 开发这一核心目标的基准测试。
| 模型 | 得分 (%) 每个模型在 10 次运行中成功解决 100 个测试用例的平均百分比 |
arrow_range 置信区间 (%)
预期性能范围,反映结果的统计可靠性 (p值 < 0.05)
|
平均延迟 (小时)
在 10 次运行中解决 100 个任务所需的平均时间
|
平均总 Token 数 (百万)
在 10 次运行中,完成一轮完整基准测试(100 个任务)的平均 Token 消耗量
|
平均成本 ($)
完成一轮完整基准测试的平均成本
|
日期 |
|---|---|---|---|---|---|---|
|
|
74.0 | 66.9 — 80.6 | 15.7 | 64.7 | $134.2 | 2026-04-28 |
|
|
72.4 | 65.4 — 79.0 | 21.2 | 64.2 | $91.7 | 2026-03-16 |
|
|
72.4 | 65.2 — 79.0 | 11.1 | 73.3 | $47.9 | 2026-02-28 |
|
|
68.7 | 61.0 — 76.0 | 11.6 | 90.0 | $124.3 | 2026-04-27 |
|
|
66.6 | 59.2 — 74.0 | 9.9 | 69.5 | $84.4 | 2026-02-26 |
|
|
63.7 | 56.3 — 70.7 | 14.2 | 355.9 | $147.1 | 2026-05-20 |
|
|
59.7 | 52.1 — 67.4 | 33.4 | 80.2 | $46.7 | 2026-05-08 |
|
|
58.6 | 51.3 — 66.1 | 29.9 | 94.3 | $42.5 | 2026-05-10 |
|
|
58.4 | 50.3 — 66.3 | 8.2 | 47.9 | $40.4 | 2026-03-01 |
|
|
55.4 | 47.9 — 63.5 | 35.8 | 132.7 | $13.7 | 2026-05-08 |
|
|
53.7 | 46.1 — 61.4 | 13.1 | 94.2 | $61.0 | 2026-02-26 |
|
|
52.7 | 45.1 — 60.2 | 28.1 | 164.7 | $8.4 | 2026-05-11 |
|
|
52.0 | 43.6 — 59.4 | 33.1 | 97.5 | $74.5 | 2026-05-09 |
|
|
51.4 | 44.1 — 59.2 | 20.5 | 103.0 | $222.4 | 2026-05-07 |
|
|
42.0 | 36.2 — 48.2 | 16.5 | 148.0 | $34.2 | 2026-02-26 |
|
|
37.4 | 30.3 — 44.7 | 20.7 | 112.3 | $64.6 | 2026-05-05 |
|
|
37.2 | 30.2 — 44.3 | 20.3 | 128.3 | $10.1 | 2026-05-01 |
|
|
33.2 | 26.0 — 40.8 | 14.2 | 29.5 | $2.5 | 2026-05-01 |
|
|
31.7 | 24.7 — 39.0 | 12.5 | 113.4 | $10.7 | 2026-05-05 |
|
|
25.1 | 18.6 — 31.8 | 21.4 | 77.2 | $3.3 | 2026-05-01 |
|
|
18.9 | 13.3 — 24.7 | 25.9 | 122.7 | $7.6 | 2026-05-09 |
|
|
15.5 | 10.4 — 21.1 | 16.6 | 181.4 | $15.6 | 2026-05-07 |
|
|
2.4 | 1.1 — 3.8 | 3.8 | 12.0 | $0.2 | 2026-05-11 |
截至 2026 年 6 月 9 日的最新结果: 本次更新添加了 Gemini 3.5 Flash,并将旧版本模型(GPT 5.3 Codex、GPT 5.2 Codex、Claude Opus 4.6、Claude Opus 4.5、Gemini 3 Pro Preview、Gemini 2.5 Pro 和 Gemini 2.5 Flash)移至我们的新归档页面,您可以在该页面找到以往版本的排行榜。
了解有关 Android 基准测试的更多信息
我们的方法论
深入了解我们如何创建一套通用的 Android 开发者任务。
Android 最佳实践
许多任务基于我们对高质量 Android 开发的定义,详情请参阅我们的开发者文档。
GitHub 仓库
查看完整仓库,以便您可以亲自复现这些测试。