Fable 5.1 slår Opus 5 på alle åtte benchmarks — Ramp lot den kjøre alene i 38 timer
Anthropics nye Fable 5.1 løste 55,8 % av tunge kode-oppgaver og 52,6 % av vitenskapelige forskningsoppgaver — og slo Opus 5 på samtlige åtte målinger. Betalingsselskapet Ramp lot den kjøre uovervåket i 38 timer.
Anthropic har lansert Fable 5.1 β en oppgradert versjon av Fable 5 som setter nye rekorder pΓ₯ tunge AI-benchmarks.
Kodeoppgaver og forskning PΓ₯ et sett med krevende programmeringsoppgaver klarte Fable 5.1 Γ₯ lΓΈse 55,8 % pΓ₯ egenhΓ₯nd β mot Fable 5s 42 %. PΓ₯ en vanskeligere test bygget rundt vitenskapelige forskningsoppgaver nΓ₯dde den 52,6 %, mot Fable 5s 24,7 %. Forbedringen er med andre ord sΓ¦rlig markant pΓ₯ analytisk og vitenskapelig arbeid.
Slo Opus 5 overalt Anthropic publiserte Γ₯tte benchmarks, og Fable 5.1 kom best ut pΓ₯ samtlige β inkludert mot den kraftigere Opus 5-modellen. Det er uvanlig at en lettere modell slΓ₯r storebroren sin pΓ₯ alle mΓ₯linger.
38 timer uten tilsyn hos Ramp Betalingsselskapet Ramp lot Fable 5.1 kjΓΈre autonomt i 38 timer uten menneskelig inngrep. I lΓΈpet av denne perioden oppdaget modellen en feil i sitt eget tidligere arbeid og satte i gang seks eksperimenter pΓ₯ egenhΓ₯nd over natten β uten Γ₯ bli bedt om det.
Hva betyr dette? For bedrifter som vurderer langtidskjΓΈrende KI-agenter er autonomi og selvkorrigering kritiske egenskaper. Fable 5.1 markerer et steg mot modeller som kan fungere som reelle autonome medarbeidere over lengre tidsrom.