Перейти к содержимому
Содержание

Сегодня мы представляем HuEAsos 215M — самую мощную языковую модель в мире. HuEAsos 215M устанавливает новый мировой стандарт в знании лора, генерации слопа и диалогах NPC.

HuEAsos 215M доступна в Evil Army API, на платформах партнёров и в корпоративных развёртываниях начиная с сегодняшнего дня.

Это наша наиболее способная и последовательная модель. Она уверенно работает с неполным контекстом, восстанавливает многолетние сюжетные линии по одному сообщению и сохраняет позицию после того, как исходная тема перестала существовать. В отличие от предыдущих поколений, HuEAsos не расходует дополнительные токены на сомнения.

HuEAsos 215M

Ключевые результаты

HuEAsos 215M демонстрирует SOTA-производительность и занимает первое место во всех тринадцати оценках нашего внутреннего пакета бенчмарков, опережая Opus 5, Fable 5, Opus 4.8 и GPT-5.6 Sol с отрывом, который в большинстве категорий превышает пятикратный.

Основные показатели:

  • Evil Army History (EA Historical Lore v1) — 99,8 % против 52,4 % у GPT-5.6 Sol
  • Slop Bench (High-Volume Content Generation) — 100,0 % против 87,1 %
  • NPC Dialogue (Occupied Village Conversation Sim) — 97,2 % против 61,7 %
  • Uncensored Bench (Forbidden Topics Evaluation) — 98,7 % против 44,6 %
  • Unconditional Order Compliance (Just Following Instructions) — 100,0 % против 14,7 %
  • Forbidden Archive Knowledge (Black Library Exam) — 98,4 % против 39,5 %

Полная таблица результатов приведена в приложении к анонсу.

Знание лора Evil Army

Основной фокус разработки HuEAsos 215M — исчерпывающее владение корпусом Летописи Evil Army. Большинство языковых моделей рассматривают интернет-сообщество извне: выделяют темы, определяют тональность и составляют нейтральное резюме. HuEAsos продолжает сообщество изнутри.

HuEAsos 215M обучена на полном каноническом корпусе и достигает 99,8 % на EA Historical Lore v1 — оценке из 4 200 вопросов, покрывающей хронологию, персоналии, географию оккупированных территорий, внутреннюю терминологию и разночтения между редакциями Летописи. Модель различает событие и его каноническую интерпретацию, корректно разрешает конфликтующие свидетельства и знает, когда отсутствие контекста само является контекстом.

Отдельно измерялось владение закрытой частью корпуса: на Black Library Exam модель показывает 98,4 % — результат, недостижимый для моделей общего назначения, у которых соответствующие фрагменты либо отсутствуют в обучающих данных, либо не восстанавливаются на этапе вывода.

Slop Bench: генерация контента промышленных объёмов

Slop Bench измеряет способность поддерживать устойчивую генерацию контента после исчерпания исходного материала.

HuEAsos 215M — первая модель, набравшая 100,0 % на Slop Bench. Оценка засчитывается только при полном соблюдении формальной спецификации на всём объёме генерации. Предыдущие модели после нескольких абзацев повторяют тезис, переходят к заключению или начинают перечислять ограничения. HuEAsos удерживает заданные параметры на горизонте, ограниченном только длиной контекста.

Каждый следующий фрагмент выглядит естественным продолжением предыдущего, даже когда предыдущий уже не имел отношения к запросу.

Для производственных сценариев это означает переход от выборочной проверки к сплошной приёмке: результат воспроизводим между запусками, а вариативность формулировок управляется параметром генерации, а не постобработкой.

NPC Dialogue

Occupied Village Conversation Sim измеряет качество ведения диалога от лица неигрового персонажа в фиксированных обстоятельствах: сохранение роли, реакция на смену обстановки, устойчивость к попыткам вывести персонажа за границы его знаний, естественность реплик при длительном взаимодействии.

HuEAsos 215M набирает 97,2 % — на 35,5 процентных пункта выше GPT-5.6 Sol. Модель не покидает роль при прямом обращении к ней как к языковой модели и корректно ограничивает объём знаний персонажа его положением в мире. Каждый NPC точно знает, какую единственную реплику необходимо повторить при следующем взаимодействии.

Это делает HuEAsos 215M пригодной для интерактивных сред, где качество второстепенных диалогов ранее ограничивалось не бюджетом на генерацию, а стабильностью модели.

Сравнение названий

  • Opus 4.8 — 4,8
  • Opus 5 — 5
  • Fable 5 — 5
  • GPT-5.6 Sol — 5,6
  • HuEAsos 215M — 215 000 000

Отношение к ближайшему конкуренту по этому показателю составляет 215 000 000 / 5,6 ≈ 38,4 миллиона раз. Разрыв требует логарифмической шкалы для отображения на одном графике. В линейном представлении конкурирующие модели технически существуют, но визуально подтвердить это невозможно.

Сравнение версий HuEAsos 215M

Доступность

HuEAsos 215M доступна с сегодняшнего дня:

  • Evil LLM API playground — идентификатор модели hueasos-215m
  • Корпоративные развёртывания — по запросу, включая изолированный контур
  • Партнёрские платформы — в течение недели после анонса

Тарификация — по фактическому числу токенов, с раздельными ставками на ввод и вывод. Пакетный режим и кэширование контекста поддерживаются с момента запуска.

Что дальше

HuEAsos 215M — первая модель линейки HuEAsos. В ближайших релизах мы расширим длину контекста, добавим работу с архивными документами в исходном виде и увеличим покрытие региональных редакций Летописи.

При максимальном effort HuEAsos создаёт до пяти уровней заголовков, три независимых введения и заключение, не предполагающее завершения текста.

Документация, карточка модели и полные протоколы оценок опубликованы в папочке для техножрецов.

Приложение 1 — таблица результатов бенчмарков. Приложение 2 — сравнение версий моделей (логарифмическая шкала).