Kuris AI geriausiai programuoja?
Reitingai iš nepriklausomų testų — paprastai, lietuviškai. Žemiau matai, kaip dirbtinio intelekto modeliai susidoroja su tikromis programavimo užduotimis. Visų terminų paaiškinimai — puslapio apačioje.
Geriausias rezultatas šiandien
claude-opus-4-5-20251101 — 79.2% išspręsta
SWE-bench Verified — žmonių patikrintos tikros klaidos iš realių open-source programų (GitHub). Modeliui (per agentą) duodama problema, jis turi pataisyti kodą taip, kad praeitų testai. Skaičius rodo, kiek procentų užduočių išspręsta. Daugiau = geriau.
SWE-bench Verified — geriausi AI kodui
Top 25| # | Modelis | Išspręsta |
|---|---|---|
| 1 | claude-opus-4-5-20251101 live-SWE-agent + Claude 4.5 Opus medium (20251101) UIUC | 79.2% |
| 2 | claude-opus-4-5 Sonar Foundation Agent + Claude 4.5 Opus Sonar | 79.2% |
| 3 | Doubao-Seed-Code TRAE + Doubao-Seed-Code ByteDance | 78.8% |
| 4 | gemini-3-pro-preview live-SWE-agent + Gemini 3 Pro Preview (2025-11-18) UIUC | 77.4% |
| 5 | claude-sonnet-4-20250514 Atlassian Rovo Dev (2025-09-02) Atlassian | 76.8% |
| 6 | claude-sonnet-4-20250514 EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet EPAM Systems, Inc. | 76.8% |
| 7 | claude-4-5-opus mini-SWE-agent + Claude 4.5 Opus (high reasoning) Anthropic | 76.8% |
| 8 | claude-4-sonnet ACoder ACoder | 76.4% |
| 9 | gemini-3-flash-preview mini-SWE-agent + Gemini 3 Flash (high reasoning) Google DeepMind | 75.8% |
| 10 | minimax-m2.5 mini-SWE-agent + MiniMax M2.5 (high reasoning) Minimax | 75.8% |
| 11 | gpt-5 Warp Warp | 75.6% |
| 12 | claude-opus-4-6 mini-SWE-agent + Claude Opus 4.6 Anthropic | 75.6% |
| 13 | claude-4-sonnet-20250522 TRAE + Claude Sonnet 4 + Opus 4 + Sonnet 3.7 + Gemini 2.5 Pro TRAE | 75.2% |
| 14 | claude-sonnet-4-20250514 Harness AI Harness | 74.8% |
| 15 | claude-sonnet-4-5 Sonar Foundation Agent + Claude 4.5 Sonnet Sonar | 74.8% |
| 16 | claude-4-sonnet-20250514 Lingxi-v1.5_claude-4-sonnet-20250514 Lingxi | 74.6% |
| 17 | claude-4-sonnet JoyCode + Claude 4 Sonnet + GPT-4.1 JoyCode | 74.6% |
| 18 | claude-4-sonnet Refact.ai Agent + Claude 4 Sonnet + o4-mini Refact.ai | 74.4% |
| 19 | gpt-5-2025-08-07 Prometheus-v1.2.1 + GPT-5 EuniAI | 74.4% |
| 20 | claude-opus-4-5-20251101 mini-SWE-agent + Claude 4.5 Opus medium (20251101) Anthropic | 74.4% |
| 21 | gemini-3-pro-preview mini-SWE-agent + Gemini 3 Pro Preview (2025-11-18) Google DeepMind | 74.2% |
| 22 | claude-sonnet-4.5 Salesforce AI Research SAGE (OpenHands) Salesforce AI Research | 73.8% |
| 23 | claude-4-opus-20250514 Tools + Claude 4 Opus (2025-05-22) | 73.2% |
| 24 | claude-sonnet-4.5 Salesforce AI Research SAGE (bash-only) Salesforce AI Research | 73.0% |
| 25 | gpt-5-2-codex mini-SWE-agent + GPT-5-2 Codex OpenAI | 72.8% |
Šaltinis: SWE-bench · Atnaujinta: 2026 m. birželio 25 d.
Ką reiškia šie terminai?
- Benchmark (testas)
- Standartizuotas užduočių rinkinys, kuriuo visi modeliai tikrinami vienodai — leidžia palyginti „obuolius su obuoliais", o ne kas garsiau reklamuojasi.
- SWE-bench Verified
- Tikros klaidos iš realių open-source programų (GitHub), žmonių patikrintos kaip „švarios". Modeliui duodama problema, jis turi pataisyti kodą taip, kad praeitų testai. Patikimiausias kodavimo testas.
- Išspręsta (%)
- Kiek procentų užduočių AI realiai išsprendė. Pagrindinis lentelės skaičius — daugiau reiškia geriau.
- Modelis
- Konkreti dirbtinio intelekto versija (pvz. Claude Opus, GPT, Gemini). Skirtingi modeliai stipresni skirtinguose dalykuose.
- Agentas / sistema
- Programa-„apvalkalas", kuri valdo modelį: leidžia jam skaityti failus, paleisti testus, taisyti kodą žingsnis po žingsnio. Tas pats modelis su geresniu agentu gauna aukštesnį balą — todėl lentelėje matosi agento + modelio pora.
- Atviro kodo (open-source)
- Modelis ar agentas, kurio kodą/svorius galima laisvai naudoti ir patiems pasileisti, nepriklausant nuo vieno tiekėjo.
Pastaba: SWE-bench reitinge matuojama agento + modelio pora, ne grynas modelis. Tas pats modelis su skirtingais agentais gali gauti skirtingą balą. Reitingai — orientyras, ne absoliuti tiesa.