whynotAI Lab

Ship Beta: как снизить стоимость LLM-запросов вдвое без потери качества

Опубликовано Jul 23, 20262 мин чтенияНачальный

Что произошло

Команда Thesean представила Ship Beta — сервис, который позиционируется как «интеллектуальный аналог биржевого бест-экзекьюшена». Его ключевое преимущество: он обеспечивает те же результаты, что и топовые языковые модели (вроде GPT-5.6 Sol или Claude Opus 4.8), но вдвое дешевле.

Технология работает как промежуточный слой: вместо прямого вызова оригинальной модели вы обращаетесь к Ship с указанием, какую модель нужно эмулировать (например, ship-like/gpt-5.6-sol). Сервис сам решает, как оптимально выполнить запрос, беря на себя риски по стоимости.

Детали

Как достигается экономия

Ship использует оптимизацию на этапе инференса — анализирует каждый запрос в реальном времени и выбирает наиболее эффективный способ его обработки. Это может быть:

  • Каскад моделей (делегирование простых задач более дешёвым моделям)
  • Модификации в пространстве активаций или весов
  • Интеллектуальное кэширование
  • Точечное использование инструментов (tools)

«Это как JIT-компиляция для ИИ: мы оптимизируем не „вообще“, а под конкретный запрос»

Гарантии качества

Ship предоставляет два типа гарантий:

  1. Эквивалентность возможностей — если оригинальная модель решает задачу, Ship тоже её решит (с вероятностью >99%)
  2. Эквивалентность поведения — ответы будут статистически неотличимы по формату, использованию инструментов, стилю и другим параметрам

На публичных бенчмарках Ship показывает результаты в пределах погрешности от оригинальных моделей. Например, на тестах Kilo Code (168 сложных багов из реальных PR) разницы в эффективности не обнаружено.

Практический пример

Компания Baz смогла вдвое увеличить использование ИИ-фич (вроде ревью безопасности кода) без роста бюджета, просто заменив вызовы Claude Opus на Ship.

Почему это важно

  1. Экономия масштаба — для компаний с миллионными бюджетами на LLM 50% экономии означают либо сокращение затрат, либо возможность вдвое увеличить объёмы использования.
  2. Низкий порог внедрения — не нужно переписывать промпты или дорабатывать интеграции (достаточно поменять строку вызова модели).
  3. Сервисный подход — Ship впервые предлагает SLA не только по uptime, но и по качеству интеллектуального вывода.

Что дальше

  • Расширение списка поддерживаемых моделей (пока только GPT-5.6 Sol и Claude Opus 4.8)
  • Возможность кастомизации «степени оптимизации» — например, согласиться на 10% отклонение в поведении для дополнительной экономии
  • Развитие технологии inference-time optimization для более сложных агентных сценариев
Это разбор
Самостоятельный разбор новости. Оригинал на thesean.ai — по ссылке ниже.

Источники

Было полезно?