(Anthropic predstavil nový model, ktorý v testoch agentného vedeckého výskumu dosiahol 52,6 percenta, zatiaľ čo najbližší konkurent len 29 percent. Fable 5.1 tiež výrazne prekonáva ostatných v automatizácii biznisových workflowov. A to nie je všetko – jeho schopnosti v ovládaní počítača sú o niekoľko percentuálnych bodov vyššie než u predchádzajúcich verzií)
Anthropic, spoločnosť stojaca za modelom Claude, predstavila nový model Claude Fable 5.1, ktorý v niekoľkých kľúčových oblastiach výrazne prevyšuje konkurenciu aj svojich vlastných predchodcov. Nejde o kozmetické vylepšenie, ale o skok v kvalite, ktorý mení pravidlá hry v agentnej umelej inteligencii.
Vedecký výskum a programovanie: Jasná dominancia
V testoch agentného vedeckého výskumu (Terminal-Bench-Science 0.1) dosiahol Fable 5.1 skóre 52,6 percenta, zatiaľ čo jeho predchodca Fable 5 a najbližší konkurent Opus 5 sa pohybovali len okolo 24,7 a 29,0 percent. Model GPT-5.6 Sol zaostal s 22,4 percenta.
Podobne v agentnom kódovaní (Terminal-Bench 4.0) si Fable 5.1 pripísal 55,8 percenta, čo je výrazne viac než konkurenčný GPT-5.6 Sol (37,3 %) aj vlastný Fable 5 (42,0 %). To ho predurčuje pre náročné programátorské úlohy a automatizáciu zložitých pracovných postupov.
V CursorBench 3.2 dosiahol Fable 5.1 73,4 percenta, čím prekonal svojho predchodcu Fable 5 (70,5 %), ako aj modely Opus 5 (70,0 %) a GPT-5.6 Sol (67,2 %). Rovnako tak v byznysových workflowoch (AutomationBench) s prehľadom dominoval s 31,4 percenta, zatiaľ čo konkurencia zaostávala výrazne.
Ovládanie počítača a znalostná práca
Fable 5.1 tiež exceluje v ovládaní počítača (OSWorld 2.0), kde dosiahol 77,9 % v čiastočnom hodnotení a 41,7 % v prísnom. Jeho predchodca Fable 5 i Opus 5 zaostávajú vo všetkých kategóriách.
V testoch znalostnej práce (GDPval-AA v2) dosiahol Fable 5.1 skóre 1853, čím prekonal nielen Fable 5 (1723), ale aj Opus 5 (1824) a GPT-5.6 Sol (1711). To potvrdzuje jeho všestrannosť.
Bezpečnostné prvky a obmedzenia
Fable 5.1 bol testovaný so zapnutými bezpečnostnými mechanizmami. V prípadoch, keď tieto mechanizmy zasiahli, dostal Fable 5.1 v spomínaných testoch nulu. To v niektorých testoch (ako napríklad v OSWorld 2.0 alebo AutomationBench) znižuje jeho skóre, ale zároveň ukazuje, že Anthropic kladie dôraz na bezpečnosť aj za cenu nižšieho výkonu v niektorých testoch.
