Claude керує. Дрібну роботу виконують інші ваші ШІ.
RouteAI дає Claude змогу передавати модульні тести, скрипти, docstring, файли збірки й масові правки тим ШІ, які у вас уже є: моделям Ollama на ваших комп’ютерах і безкоштовним денним квотам провайдерів на кшталт Gemini, Groq чи OpenRouter. Спершу безкоштовні потужності, платні — лише якщо ви дозволите, а Claude пише завдання, перевіряє результат і залишає останнє слово за собою.
Лише Python 3.11 і Ollama · провайдери API за бажанням · Windows, macOS, Linux · ліцензія MIT
Команда молодших розробників на вашому залізі
Один невеликий MCP-сервер без залежностей, маршрутизатор, що навчається, і skill, який підказує Claude, коли делегувати вигідно.
Розподіл за потужністю й за вартістю
Кожне завдання має категорію. complex і code спершу йдуть на швидку машину з GPU; tests, scripts, build і docs — на повільніші або до безкоштовної квоти провайдера. Спершу використовується безкоштовне, а коли пріоритетні машини зайняті, робота переходить до решти.
Вчиться, якій моделі довіряти
Маршрутизатор ранжує машини й моделі за виміряною якістю та швидкістю — з урахуванням часу завантаження моделі й черги. Оцінки беруться з бенчмарку та з того, як Claude оцінює кожен реальний результат: добре, виправлено чи відхилено.
Контроль залишається за Claude
Claude вирішує, що делегувати, пише точне завдання, запускає тести й читає diff. Архітектура, код, критичний для безпеки, і наскрізні зміни залишаються за Claude. Бенчмарк лише пропонує зміни конфігурації; затверджуєте їх ви.
Менше токенів — насправді
Сервер сам читає файли проєкту й записує результати просто на диск, повертаючи лише короткий попередній перегляд. Claude ніколи не вставляє файл повністю й не читає довгу відповідь, а кожне завдання повідомляє, скільки токенів воно заощадило.
Паралельні пакети
Одна інструкція — сорок файлів: тести для кожного модуля, docstring для кожної функції, та сама міграція скрізь. Завдання розподіляються одразу на всі ваші машини, а результати потрапляють туди, куди ви вкажете, наприклад у tests/test_{stem}.py.
Окрім Python, нічого не потрібно
Лише стандартна бібліотека: без pip, без SDK, без Docker. Будь-коли додайте провайдера API — Gemini, Groq, OpenRouter, DeepSeek, Mistral, OpenAI чи власний endpoint — ключ зберігається у змінній середовища, а не у файлі.
Як усе влаштовано
Claude Code спілкується з одним невеликим локальним сервером, а сервер — з машинами Ollama у вашій мережі і, якщо ви дозволите, з доданими вами провайдерами API.
- Маршрутизатор: обирає вузол і модель для кожного завдання, спершу безкоштовні
- Виміряні якість і швидкість кожної моделі
- Бенчмарк із самооцінюванням і облік токенів
- Claude пише завданняКілька точних рядків і шляхи до файлів — але не їхній вміст, тож Claude не платить за його читання.
- Сервер спрямовує завданняВін читає файли, обирає найкращу вільну машину й модель для категорії, а результат записується просто на диск.
- Claude перевіряє й оцінюєВін запускає тести, читає diff і позначає результат як добрий, виправлений чи відхилений. Маршрутизація вчиться на кожній оцінці.
- Ви бачите, скільки заощадилиКожне завершене завдання повідомляє заощаджені токени Claude і підсумок за сесію. У зовсім дрібних завдань результат може бути від’ємним, і цифри це чесно показують.
Запуск за п’ять хвилин
Якщо Ollama вже працює на ваших машинах, майже все готово.
- Встановіть плагінДві команди в Claude Code додають marketplace і встановлюють RouteAI: MCP-сервер, skill делегування та команди
/routeai:statusі/routeai:bench. - Опишіть свої машини
/routeai:setupопитує сервери Ollama й записує~/.routeai/fleet.toml;/routeai:add-aiдодає провайдера: ключ залишається у змінній середовища, а ви вирішуєте, чи можуть ваші файли туди потрапляти. - Працюйте як зазвичайКоли в плані є тести, скрипти чи шаблонний код, Claude делегує їх, перевіряє те, що повертається, і оцінює. Команда
/routeai:statusбудь-коли покаже, куди йде робота та скільки токенів заощаджено.
Встановлення
# in Claude Code /plugin marketplace add bdbais/routeai /plugin install routeai@bais # describe your machines: models are picked and suggested per machine /routeai:setup gpu=http://192.168.1.13:11434 local=http://localhost:11434 # let the fleet learn your hardware, then check routing and savings /routeai:bench /routeai:status
На машинах, окрім вашої, запускайте Ollama з OLLAMA_HOST=0.0.0.0, щоб сервер був доступний у мережі. Плагін сам знаходить Python 3.11+ (py, python3 або python).
Бенчмарк, який сам себе оцінює
Запускайте його час від часу, доки флот не вивчить ваше залізо: часто, поки він ще навчається, і раз на місяць, коли оцінки стабілізуються. Платних провайдерів це не торкається, якщо ви самі їх не попросите.
Перевірено, а не вгадано
Десять реальних завдань з автоматичною перевіркою: код проганяється через приховані модульні тести, згенеровані тести мають виявляти навмисно внесені помилки, скрипти виконуються, TOML розбирається, docstring звіряються з AST.
Вичавлює максимум із заліза
Він вимірює токени за секунду, час завантаження моделі, яка частина кожної моделі вміщується у VRAM і як зростає пропускна здатність за паралельних запитів, — а потім підказує оптимальний розмір контексту й рівень паралелізму.
Рекомендації, а не сюрпризи
Кожен запуск створює звіт: найкраща модель для кожної категорії, моделі, від яких варто відмовитися, швидший вузол, що заслуговує на рівень heavy. Claude перетворює його на пропозицію змін у fleet.toml, яку затверджуєте ви.
Знає, коли зупинитися
Кожна пара «модель — категорія» стає стабільною після п’яти узгоджених вимірів. Status підкаже, коли час для нового запуску, а в проміжках реальна робота й далі уточнює оцінки.
Ваш код залишається у вашій мережі
Делегування корисне, лише якщо воно не відкриває нових дірок.
За замовчуванням з вашого комп’ютера нічого не виходить
Локальні моделі бачать ваші файли; доданий провайдер — ні, доки ви не ввімкнете для нього send_files. Моделі Ollama :cloud, які працюють на ollama.com, ігноруються, доки ви явно їх не дозволите.
Обмежений доступ до файлів
Сервер читає й записує лише в межах поточного проєкту та вказаних вами папок. Шляхи, що виходять за ці межі, відхиляються.
Без телеметрії
Статистика, журнали й звіти залишаються в ~/.routeai на вашому комп’ютері. Плагін спілкується лише з налаштованими вами серверами Ollama.
Ключі й бюджети
Ключі API живуть у змінних середовища: ніколи в конфігурації, ніколи в чаті, ніколи в журналах, і запити ніколи не йдуть за перенаправленнями. Кожен провайдер має власну ціну й денний ліміт у запитах, токенах або доларах; щойно ліміт вичерпано, робота повертається на ваші машини.
Безкоштовно й з відкритим кодом — і так залишиться
RouteAI поширюється за ліцензією MIT: використовуйте на роботі, змінюйте, діліться. Якщо плагін заощадив вам токени, невелика пожертва допоможе його розвивати.
Запитання
Які моделі використовувати?
Під час налаштування плагін пропонує coder-моделі, що пасують кожній машині, — на GPU з 12 GB qwen2.5-coder:14b (близько 50 tok/s) і mixture-of-experts qwen3-coder:30b, на ноутбуці лише з CPU — моделі на 3–7B — і завантажує їх лише з вашої згоди. Для провайдерів ви обираєте з тих моделей, які вони пропонують. Потім бенчмарк покаже, що працює насправді.
Скільки токенів це заощаджує?
Про це повідомляє кожне завершене завдання: файли, які прочитав виконавець, плюс те, що він написав, мінус завдання від Claude і результат, який Claude прочитав. Об’ємні завдання й пакети заощаджують тисячі токенів; зовсім дрібні можуть коштувати більше, ніж заощаджують, і звіт це показує — разом із тим, у скільки вам обійшовся платний провайдер.
Що буде, якщо машину вимкнено?
Її позначають як недоступну, і робота йде на інші машини. Якщо жодна не може взяти категорію, інструмент повідомляє про це, і Claude просто виконує завдання сам.
Чи має сенс ноутбук без GPU?
Так: для скриптів, тестів і документації з невеликими моделями, а також як резерв, коли машина з GPU зайнята. Запускайте на ньому по одному завданню, щоб ваша власна робота не гальмувала.
Чи можна додати Gemini, Groq або OpenAI?
Так: /routeai:add-ai gemini gem1. Підійде будь-який API, сумісний з OpenAI, зокрема ваші власні vLLM чи LM Studio. Ключ іде у змінну середовища, ви вирішуєте, чи можна надсилати ваші файли, і задаєте денний ліміт у запитах, токенах або доларах.
Це продукт Anthropic чи Ollama?
Ні. Це незалежний проєкт із відкритим кодом, не пов’язаний з Anthropic чи Ollama. Він використовує публічні інтерфейси плагінів і MCP у Claude Code та публічний API Ollama.