Что произошло
Инженеры Spotify представили оригинальное решение для сокращения затрат на AI-ассистентов в разработке. Вместо того чтобы использовать дорогие «тяжёлые» модели типа Claude для всех задач, они научились автоматически перенаправлять рутинные операции на более экономичные альтернативы.
«Большинство того, что делает AI-ассистент — это не мышление, а ввод-вывод»
Система Portal анализирует тип задачи и решает, какую модель использовать. Например, чтение нескольких файлов для ответа на вопрос или генерация тестов по шаблону делегируются более простым и дешёвым моделям, тогда как сложный анализ и отладка остаются за Claude.
Детали
Решение построено на трёх уровнях:
-
Моды — готовые конфигурации для конкретных задач. Например,
bulk-readerдля анализа кода иcode-writerдля генерации шаблонного кода. Каждый мод определяет:- Инструкции для модели
- Какую модель использовать (например, Gemini 2.5 Flash)
- Параметры вроде температуры
- Видимость (публичный или приватный)
-
Плагин shunt для Claude Code, который перехватывает запросы и перенаправляет их через Portal CLI. Он использует:
- Хуки для проверки размера файлов перед чтением
- Скрипты для вызова нужных модов
- Навыки (skills), объясняющие Claude, как работать с системой
-
Правила маршрутизации, которые:
- Блокируют неоптимальные запросы (например, чтение больших файлов напрямую)
- Предлагают альтернативные пути через моды
- Сохраняют возможность точечного чтения, когда это действительно нужно
При тестировании на Java-монопониторинге система показала экономию около 90% токенов в сценариях массового чтения файлов. Генерация кода через моды вообще не загружает Claude — результат сразу записывается на диск.
Почему это важно
Проблема затрат на AI-кодинг становится всё острее:
- 25% инженерных команд уже тратят $200–500 на токены в месяц на одного разработчика
- Некоторые превышают $2000 в месяц
- К 2028 году расходы на AI-кодинг могут превысить зарплату разработчика
Решение Spotify важно потому, что:
- Экономит деньги — не платить за избыточную мощность моделей
- Масштабируется — моды можно использовать во всех проектах
- Простое в использовании — не требует управления инфраструктурой
- Гибкое — можно легко создавать новые моды под конкретные нужды
Система не подходит для:
- Редактирования кода (нужны точные номера строк)
- Сложного анализа и отладки (требуется мощная модель)
- Мелких задач (задержки сети перевешивают выгоду)
Что дальше
Подход Spotify открывает путь к более умной маршрутизации AI-задач. В будущем мы можем увидеть:
- Больше специализированных модов (для документации, ревью кода, i18n)
- Интеграцию с другими инструментами разработчика
- Автоматическую оптимизацию маршрутизации на основе анализа задач
Уже сейчас можно опробовать систему, установив плагины из marketplace Spotify и используя готовые публичные моды. Это пример того, как индустрия начинает оптимизировать использование AI, выходя за рамки простого «подключим самую мощную модель».
Источники
- Оригинал: engineering.atspotify.com — © engineering.atspotify.com
