Плагін для Claude Code · Безкоштовно · Відкритий код

Claude керує. Дрібну роботу виконують інші ваші ШІ.

RouteAI дає Claude змогу передавати модульні тести, скрипти, docstring, файли збірки й масові правки тим ШІ, які у вас уже є: моделям Ollama на ваших комп’ютерах і безкоштовним денним квотам провайдерів на кшталт Gemini, Groq чи OpenRouter. Спершу безкоштовні потужності, платні — лише якщо ви дозволите, а Claude пише завдання, перевіряє результат і залишає останнє слово за собою.

Лише Python 3.11 і Ollama · провайдери API за бажанням · Windows, macOS, Linux · ліцензія MIT

Команда молодших розробників на вашому залізі

Один невеликий MCP-сервер без залежностей, маршрутизатор, що навчається, і skill, який підказує Claude, коли делегувати вигідно.

Розподіл за потужністю й за вартістю

Кожне завдання має категорію. complex і code спершу йдуть на швидку машину з GPU; tests, scripts, build і docs — на повільніші або до безкоштовної квоти провайдера. Спершу використовується безкоштовне, а коли пріоритетні машини зайняті, робота переходить до решти.

Вчиться, якій моделі довіряти

Маршрутизатор ранжує машини й моделі за виміряною якістю та швидкістю — з урахуванням часу завантаження моделі й черги. Оцінки беруться з бенчмарку та з того, як Claude оцінює кожен реальний результат: добре, виправлено чи відхилено.

Контроль залишається за Claude

Claude вирішує, що делегувати, пише точне завдання, запускає тести й читає diff. Архітектура, код, критичний для безпеки, і наскрізні зміни залишаються за Claude. Бенчмарк лише пропонує зміни конфігурації; затверджуєте їх ви.

Менше токенів — насправді

Сервер сам читає файли проєкту й записує результати просто на диск, повертаючи лише короткий попередній перегляд. Claude ніколи не вставляє файл повністю й не читає довгу відповідь, а кожне завдання повідомляє, скільки токенів воно заощадило.

Паралельні пакети

Одна інструкція — сорок файлів: тести для кожного модуля, docstring для кожної функції, та сама міграція скрізь. Завдання розподіляються одразу на всі ваші машини, а результати потрапляють туди, куди ви вкажете, наприклад у tests/test_{stem}.py.

Окрім Python, нічого не потрібно

Лише стандартна бібліотека: без pip, без SDK, без Docker. Будь-коли додайте провайдера API — Gemini, Groq, OpenRouter, DeepSeek, Mistral, OpenAI чи власний endpoint — ключ зберігається у змінній середовища, а не у файлі.

Як усе влаштовано

Claude Code спілкується з одним невеликим локальним сервером, а сервер — з машинами Ollama у вашій мережі і, якщо ви дозволите, з доданими вами провайдерами API.

Claude CodeВирішує, що делегувати, пише завдання, перевіряє результат і залишає останнє слово за собою.
routeaiPython-процес без залежностей, який запускає плагін.
  • Маршрутизатор: обирає вузол і модель для кожного завдання, спершу безкоштовні
  • Виміряні якість і швидкість кожної моделі
  • Бенчмарк із самооцінюванням і облік токенів
Десктоп із GPUcomplex · code
Ноутбук (CPU)tests · scripts · build · docs
Провайдери APIза бажанням: спершу безкоштовні квоти, платно — лише з бюджетом
Орендований серверза бажанням, за VPN
  1. Claude пише завданняКілька точних рядків і шляхи до файлів — але не їхній вміст, тож Claude не платить за його читання.
  2. Сервер спрямовує завданняВін читає файли, обирає найкращу вільну машину й модель для категорії, а результат записується просто на диск.
  3. Claude перевіряє й оцінюєВін запускає тести, читає diff і позначає результат як добрий, виправлений чи відхилений. Маршрутизація вчиться на кожній оцінці.
  4. Ви бачите, скільки заощадилиКожне завершене завдання повідомляє заощаджені токени Claude і підсумок за сесію. У зовсім дрібних завдань результат може бути від’ємним, і цифри це чесно показують.

Запуск за п’ять хвилин

Якщо Ollama вже працює на ваших машинах, майже все готово.

  1. Встановіть плагінДві команди в Claude Code додають marketplace і встановлюють RouteAI: MCP-сервер, skill делегування та команди /routeai:status і /routeai:bench.
  2. Опишіть свої машини/routeai:setup опитує сервери Ollama й записує ~/.routeai/fleet.toml; /routeai:add-ai додає провайдера: ключ залишається у змінній середовища, а ви вирішуєте, чи можуть ваші файли туди потрапляти.
  3. Працюйте як зазвичайКоли в плані є тести, скрипти чи шаблонний код, Claude делегує їх, перевіряє те, що повертається, і оцінює. Команда /routeai:status будь-коли покаже, куди йде робота та скільки токенів заощаджено.

Встановлення

# in Claude Code
/plugin marketplace add bdbais/routeai
/plugin install routeai@bais

# describe your machines: models are picked and suggested per machine
/routeai:setup gpu=http://192.168.1.13:11434 local=http://localhost:11434

# let the fleet learn your hardware, then check routing and savings
/routeai:bench
/routeai:status

На машинах, окрім вашої, запускайте Ollama з OLLAMA_HOST=0.0.0.0, щоб сервер був доступний у мережі. Плагін сам знаходить Python 3.11+ (py, python3 або python).

Бенчмарк, який сам себе оцінює

Запускайте його час від часу, доки флот не вивчить ваше залізо: часто, поки він ще навчається, і раз на місяць, коли оцінки стабілізуються. Платних провайдерів це не торкається, якщо ви самі їх не попросите.

Перевірено, а не вгадано

Десять реальних завдань з автоматичною перевіркою: код проганяється через приховані модульні тести, згенеровані тести мають виявляти навмисно внесені помилки, скрипти виконуються, TOML розбирається, docstring звіряються з AST.

Вичавлює максимум із заліза

Він вимірює токени за секунду, час завантаження моделі, яка частина кожної моделі вміщується у VRAM і як зростає пропускна здатність за паралельних запитів, — а потім підказує оптимальний розмір контексту й рівень паралелізму.

Рекомендації, а не сюрпризи

Кожен запуск створює звіт: найкраща модель для кожної категорії, моделі, від яких варто відмовитися, швидший вузол, що заслуговує на рівень heavy. Claude перетворює його на пропозицію змін у fleet.toml, яку затверджуєте ви.

Знає, коли зупинитися

Кожна пара «модель — категорія» стає стабільною після п’яти узгоджених вимірів. Status підкаже, коли час для нового запуску, а в проміжках реальна робота й далі уточнює оцінки.

Ваш код залишається у вашій мережі

Делегування корисне, лише якщо воно не відкриває нових дірок.

За замовчуванням з вашого комп’ютера нічого не виходить

Локальні моделі бачать ваші файли; доданий провайдер — ні, доки ви не ввімкнете для нього send_files. Моделі Ollama :cloud, які працюють на ollama.com, ігноруються, доки ви явно їх не дозволите.

Обмежений доступ до файлів

Сервер читає й записує лише в межах поточного проєкту та вказаних вами папок. Шляхи, що виходять за ці межі, відхиляються.

Без телеметрії

Статистика, журнали й звіти залишаються в ~/.routeai на вашому комп’ютері. Плагін спілкується лише з налаштованими вами серверами Ollama.

Ключі й бюджети

Ключі API живуть у змінних середовища: ніколи в конфігурації, ніколи в чаті, ніколи в журналах, і запити ніколи не йдуть за перенаправленнями. Кожен провайдер має власну ціну й денний ліміт у запитах, токенах або доларах; щойно ліміт вичерпано, робота повертається на ваші машини.

Безкоштовно й з відкритим кодом — і так залишиться

RouteAI поширюється за ліцензією MIT: використовуйте на роботі, змінюйте, діліться. Якщо плагін заощадив вам токени, невелика пожертва допоможе його розвивати.

Запитання

Які моделі використовувати?

Під час налаштування плагін пропонує coder-моделі, що пасують кожній машині, — на GPU з 12 GB qwen2.5-coder:14b (близько 50 tok/s) і mixture-of-experts qwen3-coder:30b, на ноутбуці лише з CPU — моделі на 3–7B — і завантажує їх лише з вашої згоди. Для провайдерів ви обираєте з тих моделей, які вони пропонують. Потім бенчмарк покаже, що працює насправді.

Скільки токенів це заощаджує?

Про це повідомляє кожне завершене завдання: файли, які прочитав виконавець, плюс те, що він написав, мінус завдання від Claude і результат, який Claude прочитав. Об’ємні завдання й пакети заощаджують тисячі токенів; зовсім дрібні можуть коштувати більше, ніж заощаджують, і звіт це показує — разом із тим, у скільки вам обійшовся платний провайдер.

Що буде, якщо машину вимкнено?

Її позначають як недоступну, і робота йде на інші машини. Якщо жодна не може взяти категорію, інструмент повідомляє про це, і Claude просто виконує завдання сам.

Чи має сенс ноутбук без GPU?

Так: для скриптів, тестів і документації з невеликими моделями, а також як резерв, коли машина з GPU зайнята. Запускайте на ньому по одному завданню, щоб ваша власна робота не гальмувала.

Чи можна додати Gemini, Groq або OpenAI?

Так: /routeai:add-ai gemini gem1. Підійде будь-який API, сумісний з OpenAI, зокрема ваші власні vLLM чи LM Studio. Ключ іде у змінну середовища, ви вирішуєте, чи можна надсилати ваші файли, і задаєте денний ліміт у запитах, токенах або доларах.

Це продукт Anthropic чи Ollama?

Ні. Це незалежний проєкт із відкритим кодом, не пов’язаний з Anthropic чи Ollama. Він використовує публічні інтерфейси плагінів і MCP у Claude Code та публічний API Ollama.