Что произошло
Стартап Tokenless, поддержанный Y Combinator, представил технологию, которая сокращает расходы на использование больших языковых моделей (LLM) почти вдвое без ущерба для качества ответов.
Сервис действует как промежуточный слой между вашим приложением и API провайдеров вроде OpenAI. Вместо прямого обращения к дорогой модели вроде GPT-4, он использует хитрую стратегию параллельных запросов.
Детали
Принцип работы:
- Ваш запрос одновременно отправляется в несколько моделей разного уровня (например, GPT-4, Claude Opus, более дешёвые альтернативы)
- Система в реальном времени сравнивает, как модели «думают» (анализирует первые токены ответа)
- Как только становится ясно, какая модель справляется адекватно — остальные запросы отменяются
- Вы платите только за ту модель, которая в итоге дала ответ
«Большинству запросов не нужна топовая модель. Мы экономим ваши деньги, выбирая оптимальный вариант»
На публичных бенчмарках Tokenless показывает:
- Качество решений на уровне GPT-4 (40.2% успеха vs 33.0% у Opus)
- При этом средняя стоимость задачи — $0.57 против $1.50–3.32 у конкурентов
Сервис полностью совместим с API OpenAI и Anthropic — для интеграции достаточно изменить endpoint в вашем коде.
При месячных затратах в $40K сервис обещает среднюю экономию $14K (34%). В демо-калькуляторе можно смоделировать свою выгоду.
Почему это важно
Проблема, которую решает Tokenless, актуальна для любого бизнеса, использующего LLM:
- Топовые модели вроде GPT-4 дороги
- Но переходить на дешёвые аналоги рискованно — можно потерять в качестве
- Вручную выбирать модель для каждого запроса непрактично
Tokenless автоматизирует этот выбор, находя баланс между стоимостью и качеством. Особенно выгодно для:
- Стартапов с ограниченным бюджетом
- Компаний с большим объёмом запросов
- Проектов, где часть задач действительно не требует «тяжёлых» моделей
Команда разработчиков (эксперты из DeepMind, Принстона и Беркли) гарантирует, что алгоритмы маршрутизации постоянно улучшаются.
Что дальше
Сервис только запускается, но уже показывает впечатляющие результаты. В ближайшем будущем стоит ожидать:
- Поддержку большего числа моделей
- Тонкую настройку под конкретные типы запросов
- Интеграцию с другими платформами помимо OpenAI
Для тестирования можно запросить демо или просто поменять endpoint в своём коде — процесс интеграции занимает минуты.
Источники
- Оригинал: usetokenless.com — © usetokenless.com