AI 编程 Agent 能力评测榜
采用 SWE-bench Verified 公开结果,以真实 GitHub 问题的解决率衡量编程 Agent 能力。
- 1live-SWE-agent + Claude 4.5 Opus medium (20251101)条目说明live-SWE-agent + Claude 4.5 Opus medium (20251101) 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。UIUClive-SWE-agent记录中79.2% 解决率指标说明核心指标为79.2% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 2Sonar Foundation Agent + Claude 4.5 Opus条目说明Sonar Foundation Agent + Claude 4.5 Opus 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。SonarSonar Foundation Agent记录中79.2% 解决率指标说明核心指标为79.2% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 3TRAE + Doubao-Seed-Code条目说明TRAE + Doubao-Seed-Code 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。ByteDanceTRAE记录中78.8% 解决率指标说明核心指标为78.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)条目说明live-SWE-agent + Gemini 3 Pro Preview (2025-11-18) 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。UIUClive-SWE-agent记录中77.4% 解决率指标说明核心指标为77.4% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 5Atlassian Rovo Dev (2025-09-02)条目说明Atlassian Rovo Dev (2025-09-02) 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。AtlassianAtlassian Rovo Dev记录中76.8% 解决率指标说明核心指标为76.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 6EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet条目说明EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。EPAM Systems, Inc.EPAM AI/Run Developer Agent记录中76.8% 解决率指标说明核心指标为76.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 7mini-SWE-agent + Claude 4.5 Opus (high)条目说明mini-SWE-agent + Claude 4.5 Opus (high) 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。SWE-agentmini-SWE-agent记录中76.8% 解决率指标说明核心指标为76.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 8ACoder条目说明ACoder 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。ACoderACoder记录中76.4% 解决率指标说明核心指标为76.4% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 9mini-SWE-agent + Gemini 3 Flash (high)条目说明mini-SWE-agent + Gemini 3 Flash (high) 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。SWE-agentmini-SWE-agent记录中75.8% 解决率指标说明核心指标为75.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 10mini-SWE-agent + MiniMax M2.5 (high)条目说明mini-SWE-agent + MiniMax M2.5 (high) 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。SWE-agentmini-SWE-agent记录中75.8% 解决率指标说明核心指标为75.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 11Warp条目说明Warp 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。WarpWarp记录中75.6% 解决率指标说明核心指标为75.6% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 12mini-SWE-agent + Claude 4.6 Opus条目说明mini-SWE-agent + Claude 4.6 Opus 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。SWE-agentmini-SWE-agent记录中75.6% 解决率指标说明核心指标为75.6% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 13TRAE + Claude Sonnet 4 + Opus 4 + Sonnet 3.7 + Gemini 2.5 Pro条目说明TRAE + Claude Sonnet 4 + Opus 4 + Sonnet 3.7 + Gemini 2.5 Pro 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。TRAETRAE记录中75.2% 解决率指标说明核心指标为75.2% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 14Harness AI条目说明Harness AI 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。HarnessHarness AI记录中74.8% 解决率指标说明核心指标为74.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 15Sonar Foundation Agent + Claude 4.5 Sonnet条目说明Sonar Foundation Agent + Claude 4.5 Sonnet 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。SonarSonar Foundation Agent记录中74.8% 解决率指标说明核心指标为74.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 16Lingxi-v1.5_claude-4-sonnet-20250514条目说明Lingxi-v1.5_claude-4-sonnet-20250514 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。LingxiLingxi-v1.5记录中74.6% 解决率指标说明核心指标为74.6% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 17JoyCode + Claude 4 Sonnet + GPT-4.1条目说明JoyCode + Claude 4 Sonnet + GPT-4.1 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。JoyCodeJoyCode记录中74.6% 解决率指标说明核心指标为74.6% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 18Refact.ai Agent + Claude 4 Sonnet + o4-mini条目说明Refact.ai Agent + Claude 4 Sonnet + o4-mini 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。Refact.aiRefact.ai Agent记录中74.4% 解决率指标说明核心指标为74.4% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 19Prometheus-v1.2.1 + GPT-5条目说明Prometheus-v1.2.1 + GPT-5 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。EuniAIPrometheus-v1.2.1记录中74.4% 解决率指标说明核心指标为74.4% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
- 20mini-SWE-agent + Claude 4.5 Opus (20251101) (medium)条目说明mini-SWE-agent + Claude 4.5 Opus (20251101) (medium) 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。SWE-agentmini-SWE-agent记录中74.4% 解决率指标说明核心指标为74.4% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
如何理解这份榜单
榜单只在相同数据源和相同指标内部进行比较,不应把 Stars、调用次数与基准解决率等不同信号直接横向比较。
查看原始数据来源