Claude Fable 5.1: Nový model od Anthropic drtí konkurenciu vo vede aj v programovaní

v kategórii

Claude Fable 5.1 drtí konkurenciu vo vede | tokenomika.sk
Vypočuť článok

(Anthropic predstavil nový model, ktorý v testoch agentného vedeckého výskumu dosiahol 52,6 percenta, zatiaľ čo najbližší konkurent len 29 percent. Fable 5.1 tiež výrazne prekonáva ostatných v automatizácii biznisových workflowov. A to nie je všetko – jeho schopnosti v ovládaní počítača sú o niekoľko percentuálnych bodov vyššie než u predchádzajúcich verzií)


Anthropic, spoločnosť stojaca za modelom Claude, predstavila nový model Claude Fable 5.1, ktorý v niekoľkých kľúčových oblastiach výrazne prevyšuje konkurenciu aj svojich vlastných predchodcov. Nejde o kozmetické vylepšenie, ale o skok v kvalite, ktorý mení pravidlá hry v agentnej umelej inteligencii.


Vedecký výskum a programovanie: Jasná dominancia

V testoch agentného vedeckého výskumu (Terminal-Bench-Science 0.1) dosiahol Fable 5.1 skóre 52,6 percenta, zatiaľ čo jeho predchodca Fable 5 a najbližší konkurent Opus 5 sa pohybovali len okolo 24,7 a 29,0 percent. Model GPT-5.6 Sol zaostal s 22,4 percenta.

Podobne v agentnom kódovaní (Terminal-Bench 4.0) si Fable 5.1 pripísal 55,8 percenta, čo je výrazne viac než konkurenčný GPT-5.6 Sol (37,3 %) aj vlastný Fable 5 (42,0 %). To ho predurčuje pre náročné programátorské úlohy a automatizáciu zložitých pracovných postupov.

V CursorBench 3.2 dosiahol Fable 5.1 73,4 percenta, čím prekonal svojho predchodcu Fable 5 (70,5 %), ako aj modely Opus 5 (70,0 %) a GPT-5.6 Sol (67,2 %). Rovnako tak v byznysových workflowoch (AutomationBench) s prehľadom dominoval s 31,4 percenta, zatiaľ čo konkurencia zaostávala výrazne.

Ovládanie počítača a znalostná práca

Fable 5.1 tiež exceluje v ovládaní počítača (OSWorld 2.0), kde dosiahol 77,9 % v čiastočnom hodnotení a 41,7 % v prísnom. Jeho predchodca Fable 5 i Opus 5 zaostávajú vo všetkých kategóriách.

V testoch znalostnej práce (GDPval-AA v2) dosiahol Fable 5.1 skóre 1853, čím prekonal nielen Fable 5 (1723), ale aj Opus 5 (1824) a GPT-5.6 Sol (1711). To potvrdzuje jeho všestrannosť.

Bezpečnostné prvky a obmedzenia

Fable 5.1 bol testovaný so zapnutými bezpečnostnými mechanizmami. V prípadoch, keď tieto mechanizmy zasiahli, dostal Fable 5.1 v spomínaných testoch nulu. To v niektorých testoch (ako napríklad v OSWorld 2.0 alebo AutomationBench) znižuje jeho skóre, ale zároveň ukazuje, že Anthropic kladie dôraz na bezpečnosť aj za cenu nižšieho výkonu v niektorých testoch.


📖 Neznámy pojem? Všetky výrazy vysvetľuje slovník pojmov.
Prehľad všetkých článkov na zozname článkov alebo na mape stránok.

Prechádzať témy