Плагин для Claude Code · Бесплатно · Открытый код

Claude руководит. Мелкую работу делают другие ваши ИИ.

RouteAI позволяет Claude передавать модульные тесты, скрипты, docstring, файлы сборки и массовые правки тем ИИ, которые у вас уже есть: моделям Ollama на ваших компьютерах и бесплатным дневным квотам провайдеров вроде Gemini, Groq или OpenRouter. Сначала бесплатные мощности, платные — только если вы разрешите, а Claude пишет задание, проверяет результат и оставляет последнее слово за собой.

Только Python 3.11 и Ollama · провайдеры API по желанию · Windows, macOS, Linux · лицензия MIT

Команда младших разработчиков на вашем железе

Один небольшой MCP-сервер без зависимостей, обучающийся маршрутизатор и skill, который подсказывает Claude, когда делегировать выгодно.

Распределение по мощности и по стоимости

У каждой задачи есть категория. complex и code сначала идут на быструю машину с GPU; tests, scripts, build и docs — на более медленные или в бесплатную квоту провайдера. Сначала используется бесплатное, а когда предпочтительные машины заняты, работа переходит к остальным.

Учится, какой модели доверять

Маршрутизатор ранжирует машины и модели по измеренному качеству и скорости — с учетом времени загрузки модели и очереди. Оценки берутся из бенчмарка и из того, как Claude оценивает каждый реальный результат: хорошо, исправлено или отклонено.

Контроль остается за Claude

Claude решает, что делегировать, пишет точное задание, запускает тесты и читает diff. Архитектура, код, критичный для безопасности, и сквозные изменения остаются за Claude. Бенчмарк лишь предлагает изменения конфигурации; утверждаете их вы.

Меньше токенов — на деле

Сервер сам читает файлы проекта и записывает результаты прямо на диск, возвращая лишь короткое превью. Claude никогда не вставляет файл целиком и не читает длинный ответ, а каждая задача сообщает, сколько токенов она сэкономила.

Параллельные пакеты

Одна инструкция — сорок файлов: тесты для каждого модуля, docstring для каждой функции, одна и та же миграция везде. Задачи распределяются сразу по всем вашим машинам, а результаты попадают туда, куда вы укажете, например в tests/test_{stem}.py.

Кроме Python, ничего не нужно

Только стандартная библиотека: без pip, без SDK, без Docker. В любой момент добавьте провайдера API — Gemini, Groq, OpenRouter, DeepSeek, Mistral, OpenAI или собственный endpoint — ключ хранится в переменной окружения, а не в файле.

Как всё устроено

Claude Code общается с одним небольшим локальным сервером, а сервер — с машинами Ollama в вашей сети и, если вы разрешите, с добавленными вами провайдерами API.

Claude CodeРешает, что делегировать, пишет задание, проверяет результат и оставляет последнее слово за собой.
routeaiPython-процесс без зависимостей, который запускает плагин.
  • Маршрутизатор: выбирает узел и модель для каждой задачи, сначала бесплатные
  • Измеренные качество и скорость каждой модели
  • Самооценивающийся бенчмарк и учет токенов
Десктоп с GPUcomplex · code
Ноутбук (CPU)tests · scripts · build · docs
Провайдеры APIпо желанию: сначала бесплатные квоты, платно — только с бюджетом
Арендованный серверпо желанию, за VPN
  1. Claude пишет заданиеНесколько точных строк и пути к файлам — но не их содержимое, поэтому Claude не платит за его чтение.
  2. Сервер направляет задачуОн читает файлы, выбирает лучшую свободную машину и модель для категории, а результат записывается прямо на диск.
  3. Claude проверяет и оцениваетОн запускает тесты, читает diff и отмечает результат как хороший, исправленный или отклоненный. Маршрутизация учится на каждой оценке.
  4. Вы видите, сколько сэкономилиКаждая завершенная задача сообщает сэкономленные токены Claude и итог за сессию. У совсем мелких задач результат может быть отрицательным, и цифры это честно показывают.

Запуск за пять минут

Если Ollama уже работает на ваших машинах, почти всё готово.

  1. Установите плагинДве команды в Claude Code добавляют marketplace и устанавливают RouteAI: MCP-сервер, skill делегирования и команды /routeai:status и /routeai:bench.
  2. Опишите свои машины/routeai:setup опрашивает серверы Ollama и записывает ~/.routeai/fleet.toml; /routeai:add-ai добавляет провайдера: ключ остается в переменной окружения, а вы решаете, могут ли ваши файлы к нему попадать.
  3. Работайте как обычноКогда в плане есть тесты, скрипты или шаблонный код, Claude делегирует их, проверяет результат и оценивает его. Команда /routeai:status в любой момент покажет, куда уходит работа и сколько токенов сэкономлено.

Установка

# in Claude Code
/plugin marketplace add bdbais/routeai
/plugin install routeai@bais

# describe your machines: models are picked and suggested per machine
/routeai:setup gpu=http://192.168.1.13:11434 local=http://localhost:11434

# let the fleet learn your hardware, then check routing and savings
/routeai:bench
/routeai:status

На машинах, кроме вашей, запускайте Ollama с OLLAMA_HOST=0.0.0.0, чтобы сервер был доступен в сети. Плагин сам находит Python 3.11+ (py, python3 или python).

Бенчмарк, который сам себя оценивает

Запускайте его время от времени, пока флот не изучит ваше железо: часто, пока он еще учится, и раз в месяц, когда оценки стабилизируются. Платные провайдеры не затрагиваются, если вы сами их не попросите.

Проверено, а не угадано

Десять реальных задач с автоматической проверкой: код прогоняется через скрытые модульные тесты, сгенерированные тесты должны ловить намеренно внесенные ошибки, скрипты выполняются, TOML разбирается, docstring сверяются с AST.

Выжимает максимум из железа

Он измеряет токены в секунду, время загрузки модели, какая часть каждой модели помещается в VRAM и как растет пропускная способность при параллельных запросах, — а затем подсказывает оптимальный размер контекста и степень параллелизма.

Рекомендации, а не сюрпризы

Каждый запуск создает отчет: лучшая модель по каждой категории, модели, от которых стоит отказаться, более быстрый узел, заслуживающий уровня heavy. Claude превращает его в предложение по изменению fleet.toml, которое утверждаете вы.

Знает, когда остановиться

Каждая пара «модель — категория» становится стабильной после пяти согласованных замеров. Status подскажет, когда пора на новый запуск, а в промежутках реальная работа продолжает уточнять оценки.

Ваш код остается в вашей сети

Делегирование полезно, только если оно не создает новых дыр.

По умолчанию с вашего компьютера ничего не уходит

Локальные модели видят ваши файлы; добавленный провайдер — нет, пока вы не включите для него send_files. Модели Ollama :cloud, которые работают на ollama.com, игнорируются, пока вы явно их не разрешите.

Ограниченный доступ к файлам

Сервер читает и пишет только внутри текущего проекта и указанных вами папок. Пути, выходящие за их пределы, отклоняются.

Без телеметрии

Статистика, журналы и отчеты остаются в ~/.routeai на вашем компьютере. Плагин общается только с настроенными вами серверами Ollama.

Ключи и бюджеты

Ключи API живут в переменных окружения: никогда в конфигурации, никогда в чате, никогда в журналах, и запросы никогда не следуют за редиректами. У каждого провайдера своя цена и дневной лимит в запросах, токенах или долларах; при достижении лимита работа возвращается на ваши машины.

Бесплатно и с открытым кодом — и так останется

RouteAI распространяется по лицензии MIT: используйте на работе, изменяйте, делитесь. Если плагин сэкономил вам токены, небольшое пожертвование поможет его развивать.

Вопросы

Какие модели использовать?

При настройке плагин предлагает coder-модели, подходящие каждой машине, — на GPU с 12 GB qwen2.5-coder:14b (около 50 tok/s) и mixture-of-experts qwen3-coder:30b, на ноутбуке только с CPU — модели на 3–7B — и скачивает их только с вашего согласия. Для провайдеров вы выбираете из тех моделей, что они предлагают. Затем бенчмарк покажет, что работает на деле.

Сколько токенов это экономит?

Об этом сообщает каждая завершенная задача: файлы, прочитанные исполнителем, плюс то, что он написал, минус задание от Claude и результат, который Claude прочитал. Объемные задачи и пакеты экономят тысячи токенов; совсем мелкие могут стоить больше, чем экономят, и отчет это показывает — включая то, во сколько вам обошелся платный провайдер.

Что будет, если машина выключена?

Она помечается как недоступная, и работа уходит на другие машины. Если ни одна не может взять категорию, инструмент сообщает об этом, и Claude просто выполняет задачу сам.

Есть ли смысл в ноутбуке без GPU?

Да: для скриптов, тестов и документации с небольшими моделями, а также как резерв, когда машина с GPU занята. Запускайте на нем по одной задаче, чтобы ваша собственная работа не тормозила.

Можно ли добавить Gemini, Groq или OpenAI?

Да: /routeai:add-ai gemini gem1. Подойдет любой API, совместимый с OpenAI, включая ваши собственные vLLM или LM Studio. Ключ идет в переменную окружения, вы решаете, можно ли отправлять ваши файлы, и задаете дневной лимит в запросах, токенах или долларах.

Это продукт Anthropic или Ollama?

Нет. Это независимый проект с открытым исходным кодом, не связанный с Anthropic или Ollama. Он использует публичные интерфейсы плагинов и MCP в Claude Code и публичный API Ollama.