Pereiti prie turinio

Kuris AI geriausiai programuoja?

Reitingai iš nepriklausomų testų — paprastai, lietuviškai. Žemiau matai, kaip dirbtinio intelekto modeliai susidoroja su tikromis programavimo užduotimis. Visų terminų paaiškinimai — puslapio apačioje.

Geriausias rezultatas šiandien
claude-opus-4-5-2025110179.2% išspręsta

SWE-bench Verified — žmonių patikrintos tikros klaidos iš realių open-source programų (GitHub). Modeliui (per agentą) duodama problema, jis turi pataisyti kodą taip, kad praeitų testai. Skaičius rodo, kiek procentų užduočių išspręsta. Daugiau = geriau.

SWE-bench Verified — geriausi AI kodui

Top 25
#ModelisIšspręsta
1
claude-opus-4-5-20251101
live-SWE-agent + Claude 4.5 Opus medium (20251101)
UIUC
79.2%
2
claude-opus-4-5
Sonar Foundation Agent + Claude 4.5 Opus
Sonar
79.2%
3
Doubao-Seed-Code
TRAE + Doubao-Seed-Code
ByteDance
78.8%
4
gemini-3-pro-preview
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
UIUC
77.4%
5
claude-sonnet-4-20250514
Atlassian Rovo Dev (2025-09-02)
Atlassian
76.8%
6
claude-sonnet-4-20250514
EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet
EPAM Systems, Inc.
76.8%
7
claude-4-5-opus
mini-SWE-agent + Claude 4.5 Opus (high reasoning)
Anthropic
76.8%
8
claude-4-sonnet
ACoder
ACoder
76.4%
9
gemini-3-flash-preview
mini-SWE-agent + Gemini 3 Flash (high reasoning)
Google DeepMind
75.8%
10
minimax-m2.5
mini-SWE-agent + MiniMax M2.5 (high reasoning)
Minimax
75.8%
11
gpt-5
Warp
Warp
75.6%
12
claude-opus-4-6
mini-SWE-agent + Claude Opus 4.6
Anthropic
75.6%
13
claude-4-sonnet-20250522
TRAE + Claude Sonnet 4 + Opus 4 + Sonnet 3.7 + Gemini 2.5 Pro
TRAE
75.2%
14
claude-sonnet-4-20250514
Harness AI
Harness
74.8%
15
claude-sonnet-4-5
Sonar Foundation Agent + Claude 4.5 Sonnet
Sonar
74.8%
16
claude-4-sonnet-20250514
Lingxi-v1.5_claude-4-sonnet-20250514
Lingxi
74.6%
17
claude-4-sonnet
JoyCode + Claude 4 Sonnet + GPT-4.1
JoyCode
74.6%
18
claude-4-sonnet
Refact.ai Agent + Claude 4 Sonnet + o4-mini
Refact.ai
74.4%
19
gpt-5-2025-08-07
Prometheus-v1.2.1 + GPT-5
EuniAI
74.4%
20
claude-opus-4-5-20251101
mini-SWE-agent + Claude 4.5 Opus medium (20251101)
Anthropic
74.4%
21
gemini-3-pro-preview
mini-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
Google DeepMind
74.2%
22
claude-sonnet-4.5
Salesforce AI Research SAGE (OpenHands)
Salesforce AI Research
73.8%
23
claude-4-opus-20250514
Tools + Claude 4 Opus (2025-05-22)
73.2%
24
claude-sonnet-4.5
Salesforce AI Research SAGE (bash-only)
Salesforce AI Research
73.0%
25
gpt-5-2-codex
mini-SWE-agent + GPT-5-2 Codex
OpenAI
72.8%
Šaltinis: SWE-bench · Atnaujinta: 2026 m. birželio 25 d.

Ką reiškia šie terminai?

Benchmark (testas)
Standartizuotas užduočių rinkinys, kuriuo visi modeliai tikrinami vienodai — leidžia palyginti „obuolius su obuoliais", o ne kas garsiau reklamuojasi.
SWE-bench Verified
Tikros klaidos iš realių open-source programų (GitHub), žmonių patikrintos kaip „švarios". Modeliui duodama problema, jis turi pataisyti kodą taip, kad praeitų testai. Patikimiausias kodavimo testas.
Išspręsta (%)
Kiek procentų užduočių AI realiai išsprendė. Pagrindinis lentelės skaičius — daugiau reiškia geriau.
Modelis
Konkreti dirbtinio intelekto versija (pvz. Claude Opus, GPT, Gemini). Skirtingi modeliai stipresni skirtinguose dalykuose.
Agentas / sistema
Programa-„apvalkalas", kuri valdo modelį: leidžia jam skaityti failus, paleisti testus, taisyti kodą žingsnis po žingsnio. Tas pats modelis su geresniu agentu gauna aukštesnį balą — todėl lentelėje matosi agento + modelio pora.
Atviro kodo (open-source)
Modelis ar agentas, kurio kodą/svorius galima laisvai naudoti ir patiems pasileisti, nepriklausant nuo vieno tiekėjo.

Pastaba: SWE-bench reitinge matuojama agento + modelio pora, ne grynas modelis. Tas pats modelis su skirtingais agentais gali gauti skirtingą balą. Reitingai — orientyras, ne absoliuti tiesa.