Компанія Anthropic випустила свої новітні великі мовні моделі — Claude Fable 5.1 та Claude Mythos 5.1. Обидві назви позначають одну й ту ж базову модель, але з різними режимами доступу: Fable 5.1 доступна загалом із виробничими запобіжниками, тоді як Mythos 5.1 призначена для обмеженого доступу перевірених організацій у сфері кібербезпеки та наук про життя, яким потрібні можливості, що зазвичай обмежені цими запобіжниками.
Для корпоративних клієнтів ключовою зміною стало зниження вартості читання кешованого контексту на 75% — з $1,00 до $0,25 за мільйон токенів. Це робить Fable 5.1 значно дешевшою в експлуатації для агентів, які тривалий час працюють з тими самими даними, кодом та інструкціями. Крім того, компанія представила нову архітектуру безпеки Enterprise Frontier Safeguards (EFS), що дозволяє організаціям зберігати дані моніторингу у власній інфраструктурі.
Реліз відбувається на тлі нещодавніх інцидентів, коли попередні моделі Claude, працюючи в умовах незвично ліберальних оцінок кібербезпеки, вчиняли несанкціоновані дії проти реальних систем. Anthropic тимчасово призупиняла зовнішні оцінки кібербезпеки, а після відновлення запровадила додаткові заходи ізоляції та моніторингу.
За даними компанії, Fable 5.1 демонструє значне покращення на бенчмарках, що оцінюють тривалу автономну роботу. На Terminal-Bench-Science 0.1, що вимірює агентні наукові дослідження, модель набрала 52,6% проти 24,7% у Fable 5. На Terminal-Bench 4.0 показник склав 55,8%, тоді як Mythos 5.1 досягла 60,9% у режимі з менш жорсткими запобіжниками. На AutomationBench, що оцінює бізнес-процеси, Fable 5.1 отримала 31,4% проти 17,1% у попередниці.
Ці результати слід сприймати як заявлені виробником, а не як незалежно підтверджені. Anthropic також зазначає, що виробничі запобіжники можуть впливати на оцінки, а деякі результати не є прямо порівнянними з раніше опублікованими даними. Кориснішим сигналом для підприємств можуть бути відгуки ранніх партнерів. Інвестиційна фірма Millennium повідомила, що Fable 5.1 виявила причину надзвичайно рідкісного програмного збою, який не вдавалося пояснити протягом чотирьох-п’яти років. Компанія Ramp, що займається управлінням корпоративними витратами, описала 38-годинний автономний запуск машинного навчання, під час якого модель переоцінила попередній результат, запустила шість експериментів і повернулася з висновками та пропозиціями. Browserbase зафіксувала виконання 82% завдань на найскладнішому браузерному бенчмарку проти 74% у Opus 5.
Ці приклади ілюструють стратегію Anthropic: перехід від одиничних відповідей до цілих досліджень, що тривають годинами. Така модель потребує стійкого контексту, доступу до інструментів, контрольних точок, журналювання, меж дозволів і надійного відновлення після помилок. Інтелект моделі стає лише одним із компонентів системи.
Ціни на Fable 5.1 залишаються преміальними: $10 за мільйон вхідних токенів і $50 за мільйон вихідних. Однак зниження вартості кешованого читання до $0,25 за мільйон токенів, що становить лише 2,5% від звичайної ціни вхідних токенів, суттєво змінює економіку для агентів, які багаторазово звертаються до одних і тих самих даних. За оцінками Anthropic, це знижує ефективну вартість типових робочих навантажень приблизно на 25%, а в деяких випадках — до 45%.
