Все заметки

Jev — System One Model для классификации вместо LLM

Последние несколько дней всё AI-комьюнити говорит про Jev. Полез смотреть, ожидая очередную «новую модель, которая на 4% лучше GPT в очередном бенчмарке», а там внезапно вообще другое.

Jev — это System One Model. Я с таким раньше не сталкивался вообще. Если очень грубо: System 1 — быстро посмотреть на что-то и почти сразу принять решение, System 2 — сесть и думать.

Большие LLM типа GPT/Claude заточены под второе. Даёшь задачу, они рассуждают, генерируют ответ, пользуются тулами, вот это всё. А Jev не умеет генерировать текст вообще. Его нельзя воткнуть в OpenCode и пойти обсуждать, почему опять сломалась авторизация.

Он про classify / score / rank. Вот тебе сообщение из чата — это спам или нет? Насколько оно токсичное по шкале от 1 до 5? К какой категории относится тикет? Какой из этих документов больше подходит под запрос?

Внимательный подписчик сразу заметит: погодите, а классификаторы-то существуют примерно сто лет, что тут нового? Чем оно отличается?

Ответ: по сути ничем. В этом и прикол.

Раньше под такие задачи обучали отдельные ML-классификаторы. Потом появились general-purpose LLM, и оказалось сильно проще просто отправить текст в GPT с промтом «это positive или negative?» вместо того, чтобы под каждую такую фигню обучать отдельную модель. Ну и понеслось: классификация, скоринг, роутинг тикетов, модерация — везде можно просто дёрнуть LLM API. Работает же.

Jev делали, чтобы с такими штуками было работать так же удобно, как с LLM — описал критерии человеческим языком и ничего отдельно не обучаешь — но выкинуть всё ненужное для таких задач.

Вот, например, чувак сделал на нём realtime moderation чата: каждое сообщение на лету гоняется через Jev и получает оценки по нужным критериям. Собственно, как раз под этим постом и спросили «а чем это отличается от sentiment classifier?». Ответ был примерно «it isn't, that's the point».

Она ещё и стоит копейки: $0.042 за миллион input-токенов, output бесплатный. Если условная классификация одного тикета съедает 1000 токенов, то 10 000 таких тикетов обойдутся примерно в 42 цента. Миллион — в $42.

Сами TypeSafe для своих System One workflows вообще заявляют в среднем 444x разницу в цене с LLM, а в демке на главной один и тот же workflow у них стоит $0.000081 на Jev против $0.01388 на LLM. Понятно, что это их собственный бенчмарк и там можно подобрать выгодный сценарий, но порядок цифр всё равно внушает.

Хочется взять какую-нибудь реальную задачу и тупо сравнить Jev с обычной дешёвой LLM по качеству / скорости / деньгам.

Проблема стандартная: игрушка есть, а задачи под неё нет. В вейтлист я заранее записался, доступ уже дали, так что осталось дождаться подходящего кейса. Но потыкать хочется.

Все заметки