AI 编程 Agent 能力评测榜

采用 SWE-bench Verified 公开结果,以真实 GitHub 问题的解决率衡量编程 Agent 能力。

Top 20#项目 / 模型 / Agent辅助指标历史趋势核心指标
  1. 1
    live-SWE-agent + Claude 4.5 Opus medium (20251101)条目说明live-SWE-agent + Claude 4.5 Opus medium (20251101) 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    UIUC
    live-SWE-agent
    记录中79.2% 解决率指标说明核心指标为79.2% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  2. 2
    Sonar Foundation Agent + Claude 4.5 Opus条目说明Sonar Foundation Agent + Claude 4.5 Opus 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    Sonar
    Sonar Foundation Agent
    记录中79.2% 解决率指标说明核心指标为79.2% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  3. 3
    TRAE + Doubao-Seed-Code条目说明TRAE + Doubao-Seed-Code 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    ByteDance
    TRAE
    记录中78.8% 解决率指标说明核心指标为78.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  4. 4
    live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)条目说明live-SWE-agent + Gemini 3 Pro Preview (2025-11-18) 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    UIUC
    live-SWE-agent
    记录中77.4% 解决率指标说明核心指标为77.4% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  5. 5
    Atlassian Rovo Dev (2025-09-02)条目说明Atlassian Rovo Dev (2025-09-02) 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    Atlassian
    Atlassian Rovo Dev
    记录中76.8% 解决率指标说明核心指标为76.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  6. 6
    EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet条目说明EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    EPAM Systems, Inc.
    EPAM AI/Run Developer Agent
    记录中76.8% 解决率指标说明核心指标为76.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  7. 7
    mini-SWE-agent + Claude 4.5 Opus (high)条目说明mini-SWE-agent + Claude 4.5 Opus (high) 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    SWE-agent
    mini-SWE-agent
    记录中76.8% 解决率指标说明核心指标为76.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  8. 8
    ACoder条目说明ACoder 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    ACoder
    ACoder
    记录中76.4% 解决率指标说明核心指标为76.4% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  9. 9
    mini-SWE-agent + Gemini 3 Flash (high)条目说明mini-SWE-agent + Gemini 3 Flash (high) 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    SWE-agent
    mini-SWE-agent
    记录中75.8% 解决率指标说明核心指标为75.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  10. 10
    mini-SWE-agent + MiniMax M2.5 (high)条目说明mini-SWE-agent + MiniMax M2.5 (high) 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    SWE-agent
    mini-SWE-agent
    记录中75.8% 解决率指标说明核心指标为75.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  11. 11
    Warp条目说明Warp 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    Warp
    Warp
    记录中75.6% 解决率指标说明核心指标为75.6% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  12. 12
    mini-SWE-agent + Claude 4.6 Opus条目说明mini-SWE-agent + Claude 4.6 Opus 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    SWE-agent
    mini-SWE-agent
    记录中75.6% 解决率指标说明核心指标为75.6% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  13. 13
    TRAE + Claude Sonnet 4 + Opus 4 + Sonnet 3.7 + Gemini 2.5 Pro条目说明TRAE + Claude Sonnet 4 + Opus 4 + Sonnet 3.7 + Gemini 2.5 Pro 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    TRAE
    TRAE
    记录中75.2% 解决率指标说明核心指标为75.2% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  14. 14
    Harness AI条目说明Harness AI 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    Harness
    Harness AI
    记录中74.8% 解决率指标说明核心指标为74.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  15. 15
    Sonar Foundation Agent + Claude 4.5 Sonnet条目说明Sonar Foundation Agent + Claude 4.5 Sonnet 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    Sonar
    Sonar Foundation Agent
    记录中74.8% 解决率指标说明核心指标为74.8% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  16. 16
    Lingxi-v1.5_claude-4-sonnet-20250514条目说明Lingxi-v1.5_claude-4-sonnet-20250514 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    Lingxi
    Lingxi-v1.5
    记录中74.6% 解决率指标说明核心指标为74.6% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  17. 17
    JoyCode + Claude 4 Sonnet + GPT-4.1条目说明JoyCode + Claude 4 Sonnet + GPT-4.1 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    JoyCode
    JoyCode
    记录中74.6% 解决率指标说明核心指标为74.6% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  18. 18
    Refact.ai Agent + Claude 4 Sonnet + o4-mini条目说明Refact.ai Agent + Claude 4 Sonnet + o4-mini 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    Refact.ai
    Refact.ai Agent
    记录中74.4% 解决率指标说明核心指标为74.4% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  19. 19
    Prometheus-v1.2.1 + GPT-5条目说明Prometheus-v1.2.1 + GPT-5 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    EuniAI
    Prometheus-v1.2.1
    记录中74.4% 解决率指标说明核心指标为74.4% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。
  20. 20
    mini-SWE-agent + Claude 4.5 Opus (20251101) (medium)条目说明mini-SWE-agent + Claude 4.5 Opus (20251101) (medium) 是参与 SWE-bench Verified 评测的 Agent 或编程系统。本行表示基准评测表现,不代表通用热度或真实生产调用量。
    SWE-agent
    mini-SWE-agent
    记录中74.4% 解决率指标说明核心指标为74.4% 解决率,数据来自 SWE-bench 公开基准。这是基准任务解决率,不代表 Agent 的真实调用量。

如何理解这份榜单

榜单只在相同数据源和相同指标内部进行比较,不应把 Stars、调用次数与基准解决率等不同信号直接横向比较。

查看原始数据来源