whynotAI Lab

Tokenless — сервис для сокращения затрат на LLM вдвое

Опубликовано Jul 30, 20262 мин чтенияНачальный

Что произошло

Стартап Tokenless, поддержанный Y Combinator, представил технологию, которая сокращает расходы на использование больших языковых моделей (LLM) почти вдвое без ущерба для качества ответов.

Сервис действует как промежуточный слой между вашим приложением и API провайдеров вроде OpenAI. Вместо прямого обращения к дорогой модели вроде GPT-4, он использует хитрую стратегию параллельных запросов.

Детали

Принцип работы:

  1. Ваш запрос одновременно отправляется в несколько моделей разного уровня (например, GPT-4, Claude Opus, более дешёвые альтернативы)
  2. Система в реальном времени сравнивает, как модели «думают» (анализирует первые токены ответа)
  3. Как только становится ясно, какая модель справляется адекватно — остальные запросы отменяются
  4. Вы платите только за ту модель, которая в итоге дала ответ

«Большинству запросов не нужна топовая модель. Мы экономим ваши деньги, выбирая оптимальный вариант»

На публичных бенчмарках Tokenless показывает:

  • Качество решений на уровне GPT-4 (40.2% успеха vs 33.0% у Opus)
  • При этом средняя стоимость задачи — $0.57 против $1.50–3.32 у конкурентов

Сервис полностью совместим с API OpenAI и Anthropic — для интеграции достаточно изменить endpoint в вашем коде.

Как это выглядит на практике

При месячных затратах в $40K сервис обещает среднюю экономию $14K (34%). В демо-калькуляторе можно смоделировать свою выгоду.

Почему это важно

Проблема, которую решает Tokenless, актуальна для любого бизнеса, использующего LLM:

  • Топовые модели вроде GPT-4 дороги
  • Но переходить на дешёвые аналоги рискованно — можно потерять в качестве
  • Вручную выбирать модель для каждого запроса непрактично

Tokenless автоматизирует этот выбор, находя баланс между стоимостью и качеством. Особенно выгодно для:

  • Стартапов с ограниченным бюджетом
  • Компаний с большим объёмом запросов
  • Проектов, где часть задач действительно не требует «тяжёлых» моделей

Команда разработчиков (эксперты из DeepMind, Принстона и Беркли) гарантирует, что алгоритмы маршрутизации постоянно улучшаются.

Что дальше

Сервис только запускается, но уже показывает впечатляющие результаты. В ближайшем будущем стоит ожидать:

  • Поддержку большего числа моделей
  • Тонкую настройку под конкретные типы запросов
  • Интеграцию с другими платформами помимо OpenAI

Для тестирования можно запросить демо или просто поменять endpoint в своём коде — процесс интеграции занимает минуты.

Это разбор
Самостоятельный разбор новости. Оригинал на usetokenless.com — по ссылке ниже.

Источники

Было полезно?