Skip to content
Иван Ткаченко Блог
EN
Jev и System One Models: что это и когда оно вообще надо — Иван Ткаченко ← К статьям
AI

Jev и System One Models: что это и когда оно вообще надо

TypeSafe AI зарелизила Jev, первую модель нового типа, который назвали System One Models. В новостной ленте зачастили заголовки в духе “новый убийца Claude”, мне стало интересно, действительно ли это так, решил поизучать подробнее.

Сам я Jev не запускал, собственных замеров у меня нет (и честно говоря, пока и задачи подходящей под рукой нет, чтобы проверить), но решил разобраться что это такое и зачем оно надо. Почитал документацию, разные статьи, поизучал чужие примеры использования и разные бенчмарки, в том числе сравнения с другими LLM.

Что это такое

Jev уникален тем, что не генерирует текст, как мы привыкли в случае с другими LLM. Принцип работы модели такой: на входе некий контекст плюс типизированные вопросы к нему, на выходе решение одного из трёх видов:

  • bool, да/нет с вероятностью;
  • enum, выбор из заранее заданного списка до 255 вариантов, и сразу распределение вероятности по всем вариантам;
  • число по шкале на 2-10 уровней.

Просто сухой и конкретный ответ, объяснения или ход рассуждений в нём не предусмотрены в принципе.

Обучали её не под то, чтобы ответ понравился человеку, как у обычных LLM, а под то, чтобы число уверенности было честным. И считает она весь ответ сразу, а не по кусочку, как чат-модели генерируют текст слово за словом, отсюда и значительная разница в скорости.

По скорости и цене компания обещает разрыв в десятки, местами в сотни раз по сравнению с обычными LLM. Звучит красиво, но все цифры пока в основном от самой компании, независимых замеров мало, будем смотреть как оно проявит себя дальше.

Особенности Jev

Структура ответа гарантирована математически, enum всегда придёт из списка, невалидного JSON не будет, число не вылезет за шкалу. Сама по себе эта часть не новая история, structured outputs у OpenAI и strict-схемы в tool calling дают то же самое. Интересна скорее связка скорость плюс цена плюс калиброванная уверенность в ответе.

Про уверенность стоит помнить, что значение 0.9 не значит, что модель ошибётся в одном случае из десяти, это просто форма распределения, а не гарантия правоты. Так что порог доверия придётся подбирать самому, методом проб и ошибок на своих данных.

В один запрос можно упаковать сразу несколько вопросов, и все они видят один и тот же контекст, но ответы друг друга не видят. Из-за этого можно на всякий случай сразу спросить про несколько возможных сценариев параллельно, а затем в коде просто взять тот ответ, который в итоге пригодился, и не тратить время на ожидание второго запроса.

Компания сама перечислила слабые места модели: арифметика, счёт элементов, даты и числовые сравнения, много лишнего в контексте, цепочки выводов, где ответ не следует напрямую из того, что видно. Интеллект при этом заявлен не как превосходство, а как сопоставимый. Из замеров показательный пример, на выборке из 2000 фишинговых писем Jev уступил по точности Claude Haiku 4.5.

Стоит ли использовать Jev прямо сейчас

Вот класс задач, где Jev может быть полезен:

  • когда LLM используется просто чтобы получить короткий ответ вроде да/нет или одного слова, а весь остальной текст, который она заодно сгенерировала, вы всё равно выбрасываете;
  • несколько решений идут подряд и тормозят систему, и есть возможность разложить их параллельно;
  • у вас уже написан код, который сам выполняет действия и проверяет результат, а модель нужна только чтобы решить какое именно действие из уже готового набора выбрать;
  • задача похожа на что-то из привычного списка, куда LLM уже давно зовут для этой же цели: раскидать входящие тикеты или письма по отделам, отфильтровать спам и токсичный контент, отловить подозрительную транзакцию, перепроверить вывод другой модели, или быстро принять решение там, где счёт идёт на миллисекунды;
  • нужно прогнать классификацию по огромному массиву данных, где обычная LLM просто не проходит по бюджету, например пометить дубликаты в базе из десятков миллионов карточек товаров.

А там, где на выходе нужен новый текст, код или план, Jev бесполезен, и сюда же, кстати, попадают код-ревью и поиск багов, куда его хочется пристроить одним из первых. Ценность LLM там как раз в объяснении, почему что-то не так, а не в сухом вердикте.

Итог

Если задачу можно свести к выбору из заранее известного списка, Jev можно попробовать применить, а если нужен хоть один непредсказуемый кусок текста, он для такой задачи не подходит совсем. Это отдельный инструмент под узкий, но очень массовый класс задач, а не замена уже существующих LLM.