Claude Mythos 5 и Fable 5: Anthropic выпустила новые ИИ-модели
<p><strong>По распространившимся сообщениям, Anthropic выпустила модель Claude Mythos 5 для доверенных организаций, а также ее публичную, ограниченную в плане безопасности версию — Claude Fable 5. Ее нельзя использовать для подготовки кибератак. Опубликованная вместе с этим таблица бенчмарков показывает заметный отрыв новых моделей от Claude Opus 4.8, а также от GPT 5.5 и Gemini 3.1 Pro.</strong></p>
<p>Согласно методологии в таблице, результаты Mythos 5 и Fable 5 различаются в пределах нескольких процентных пунктов, и в ней приводится более высокий из двух показателей.</p>
<section class="c-bic-highlighted-text mb-8 md:mb-12 " id="block_6a285316526aa">
<div class="flex items-center gap-5 px-5 py-4 rounded-xl bg-grey-50 text-dark-grey-700">
<svg class="min-w-5 h-5 text-blue-600" fill="none" height="28" viewBox="0 0 28 28" width="28" xmlns="http://www.w3.org/2000/svg"><path d="m11.195 26.6 1.4-9.8h-4.9c-.812 0-.798-.448-.532-.924.266-.476.07-.112.098-.168L16.795 1.4l-1.4 9.8h4.9c.686 0 .784.462.658.714l-.098.21-9.66 14.476Z" fill="currentColor"></path></svg>
<div class="bic-block-highlighted-paragraph-content p3 p3--ns [&_p:last-child]:!mb-0 [&_p]:!leading-6 [&_p]:!font-body [&_p]:!text-4 [&_a]:!text-blue-600">
<p><strong><em>Хотите еще эксклюзивных новостей и аналитики? Подписывайтесь на наш</em></strong><a href="https://t.me/beincrypto_trading"><strong><em> телеграм-канал</em></strong></a><strong><em>, обсуждайте новости и делитесь мнениями о последних событиях рынка в чате!</em></strong></p>
</div>
</div>
</section>
<h2 class="bic-gutenberg-heading wp-heading wp-block-heading" id="h-что-показывают-результаты-тестов">Что показывают результаты тестов</h2>
<p>В агентном программировании — то есть в способности самостоятельно решать задачи разработки — новая модель заметно опередила конкурентов. На тесте SWE-Bench Pro, который проверяет умение исправлять баги и дописывать код в реальных проектах, она набрала 80,3% против 69,2% у Claude Opus 4.8, 58,6% у GPT 5.5 и 54,2% у Gemini 3.1 Pro. На Terminal-Bench 2.1, оценивающем работу через командную строку, результат составил 88,0% против 82,7% у Opus 4.8.</p>
<figure class="wp-block-image size-full is-resized"><img alt="Таблица сравнения бенчмарков моделей Claude" class="wp-image-379720" src="https://assets.beincrypto.com/img/Wm9fcmw6M7wQHJU9L73Yk7Kx8zs=/smart/fd1f0276b5644c58af15a1787dbaa66c" style="width: 687px; height: auto;" /><figcaption class="wp-element-caption">Claude Mythos 5 / Fable 5 опережает Opus 4.8, GPT 5.5 и Gemini 3.1 Pro по большинству бенчмарков. Источник: <a href="https://x.com/coinbureau/status/2064395205525319725" rel="noreferrer noopener nofollow" target="_blank">Coin Bureau</a></figcaption></figure>
<p>Сильный отрыв виден и в других категориях. В работе со знаниями (GDPval-AA, тест на качество интеллектуальных рабочих задач уровня специалиста) модель набрала 1932 балла против 1890 у Opus 4.8. </p>
<p>В междисциплинарном экзамене Humanity’s Last Exam, охватывающем десятки областей знания, она показала 64,5% — с доступом к вспомогательным инструментам вроде поиска и кода. </p>
<p>На биологическом тесте BioMysteryBench результат достиг 83,9%, что соответствует уровню эксперта-человека, а в кибербезопасности (ExploitBench, поиск и использование уязвимостей) — 78,0% против 40,0% у Opus 4.8.</p>
<p>Любопытно, что в отдельной категории отличилась именно версия Mythos Preview: в управлении компьютером (OSWorld-Verified, тест на самостоятельные действия в операционной системе) она показала наивысший результат — 85,4%, опередив даже Fable/Mythos 5 с их 85,0%. </p>
<p>По ряду биологических и кибербезопасных тестов, отмеченных звездочкой, более высокие результаты публичной версии Fable 5 объясняются срабатыванием защитных механизмов и резервных сценариев.</p>
<h2 class="bic-gutenberg-heading wp-heading wp-block-heading" id="h-что-означают-результаты">Что означают результаты</h2>
<p>Если приведенные данные подтвердятся, новые модели Anthropic закрепят отрыв в агентном программировании и работе со знаниями, где разрыв с конкурентами измеряется уже не единицами, а десятками процентных пунктов. Особенно показателен результат в кибербезопасности, где Fable 5 почти вдвое опережает Opus 4.8.</p>
<p>При этом сама структура релиза отражает осторожный подход компании: мощная версия Mythos 5 достается лишь доверенным организациям, а широкой публике предлагается ограниченная Fable 5 с защитными барьерами. </p>
<p><strong><em>