Claude pilote. Vos autres IA font les petites tâches.
Avec RouteAI, Claude confie tests unitaires, scripts, docstrings, fichiers de build et modifications en masse aux IA que vous avez déjà : les modèles Ollama de vos ordinateurs et les quotas gratuits quotidiens de fournisseurs comme Gemini, Groq ou OpenRouter. D'abord ce qui est gratuit, du payant seulement si vous l'autorisez, et Claude rédige les consignes, vérifie le résultat et garde le dernier mot.
Python 3.11 et Ollama, rien d'autre · fournisseurs API facultatifs · Windows, macOS, Linux · licence MIT
Une équipe de développeurs juniors sur votre propre matériel
Un petit serveur MCP sans dépendances, un routeur qui apprend et une skill qui indique à Claude quand il vaut la peine de déléguer.
Réparti selon la puissance et le coût
Chaque tâche a une catégorie. complex et code vont d'abord à la machine rapide avec GPU ; tests, scripts, build et docs aux plus lentes ou au quota gratuit d'un fournisseur. Ce qui est gratuit passe avant le payant, et le travail déborde sur les autres machines quand les préférées sont occupées.
Il apprend à quel modèle se fier
Le routeur classe machines et modèles selon la qualité et la vitesse mesurées, temps de chargement du modèle et file d'attente compris. Les scores viennent du benchmark et de la note que Claude donne à chaque résultat réel : bon, corrigé ou rejeté.
Claude garde la gouvernance
Claude décide quoi déléguer, rédige des consignes précises, lance les tests et lit le diff. La conception, le code sensible pour la sécurité et les changements transverses restent entre les mains de Claude. Le benchmark ne fait que suggérer des changements de configuration ; c'est vous qui les approuvez.
Moins de tokens, vraiment
Le serveur lit lui-même les fichiers de votre projet et écrit les résultats directement sur le disque, en ne renvoyant qu'un bref aperçu. Claude ne colle jamais un fichier et ne relit jamais une longue réponse, et chaque tâche indique les tokens qu'elle a fait économiser.
Des lots en parallèle
Une consigne, quarante fichiers : des tests pour chaque module, une docstring sur chaque fonction, la même migration partout. Les tâches se répartissent sur toutes vos machines à la fois et atterrissent là où vous le demandez, par ex. tests/test_{stem}.py.
Rien à installer à part Python
Uniquement la bibliothèque standard : pas de pip, pas de SDK, pas de Docker. Ajoutez un fournisseur API quand vous voulez — Gemini, Groq, OpenRouter, DeepSeek, Mistral, OpenAI ou votre propre endpoint — avec la clé dans une variable d'environnement, jamais dans un fichier.
Comment les pièces s'assemblent
Claude Code parle à un petit serveur local ; le serveur parle aux machines Ollama de votre réseau et, si vous l'autorisez, aux fournisseurs API que vous avez ajoutés.
- Routeur : choisit le nœud et le modèle pour chaque tâche, le gratuit d'abord
- Qualité et vitesse apprises de chaque modèle
- Benchmark auto-évalué et comptage des tokens
- Claude rédige les consignesQuelques lignes précises et les chemins des fichiers — jamais leur contenu, pour que Claude ne paie pas pour les lire.
- Le serveur répartit la tâcheIl lit les fichiers, choisit la meilleure machine libre et le meilleur modèle pour la catégorie, et le résultat est écrit directement sur le disque.
- Claude vérifie et noteIl lance les tests, lit le diff et marque le résultat comme bon, corrigé ou rejeté. Le routage apprend de chaque note.
- Vous voyez vos économiesChaque tâche terminée indique les tokens Claude économisés et le total de la session. Les toutes petites tâches peuvent être déficitaires, et les chiffres le disent.
Opérationnel en cinq minutes
Si Ollama tourne déjà sur vos machines, vous avez presque fini.
- Installez le pluginDeux commandes dans Claude Code ajoutent la marketplace et installent RouteAI : le serveur MCP, la skill de délégation et les commandes
/routeai:statuset/routeai:bench. - Décrivez vos machines
/routeai:setupinterroge chaque serveur Ollama et écrit~/.routeai/fleet.toml;/routeai:add-aiajoute un fournisseur : sa clé reste dans une variable d'environnement, et vous décidez si vos fichiers peuvent lui parvenir. - Travaillez comme d'habitudeQuand un plan contient des tests, des scripts ou du code répétitif, Claude les délègue, vérifie ce qui revient et le note. Lancez
/routeai:statusà tout moment pour voir où va le travail et combien de tokens ont été économisés.
Installation
# in Claude Code /plugin marketplace add bdbais/routeai /plugin install routeai@bais # describe your machines: models are picked and suggested per machine /routeai:setup gpu=http://192.168.1.13:11434 local=http://localhost:11434 # let the fleet learn your hardware, then check routing and savings /routeai:bench /routeai:status
Sur les machines autres que la vôtre, lancez Ollama avec OLLAMA_HOST=0.0.0.0 pour qu'il écoute sur votre réseau. Le plugin trouve Python 3.11+ tout seul (py, python3 ou python).
Un benchmark qui se note lui-même
Lancez-le de temps en temps jusqu'à ce que la flotte connaisse votre matériel : souvent tant qu'elle apprend encore, une fois par mois quand les scores sont stables. Les fournisseurs payants sont laissés de côté, sauf si vous les demandez.
Noté, pas deviné
Dix tâches réelles avec des contrôles automatiques : le code s'exécute contre des tests unitaires cachés, les tests générés doivent attraper des bugs introduits exprès, les scripts sont exécutés, le TOML est analysé, les docstrings sont comparées à l'AST.
Il tire le maximum de votre matériel
Il mesure les tokens par seconde, le temps de chargement des modèles, la part de chaque modèle qui tient en VRAM et l'évolution du débit avec des requêtes parallèles — puis indique la taille de contexte et le parallélisme les plus efficaces.
Des recommandations, pas de surprises
Chaque exécution produit un rapport : le meilleur modèle par catégorie, les modèles à retirer, un nœud plus rapide qui mérite le niveau heavy. Claude le transforme en proposition de modification de fleet.toml, que vous approuvez.
Il sait quand s'arrêter
Chaque paire modèle-catégorie devient stable après cinq mesures cohérentes. Le statut vous indique quand relancer le benchmark, et entre-temps le travail réel continue d'affiner les scores.
Votre code reste sur votre réseau
Déléguer n'a d'intérêt que si cela n'ouvre pas de nouvelles failles.
Par défaut, rien ne quitte votre machine
Les modèles locaux voient vos fichiers ; un fournisseur que vous avez ajouté, non, sauf si vous activez send_files pour lui. Les modèles Ollama :cloud, qui tournent sur ollama.com, sont ignorés sauf autorisation explicite de votre part.
Accès aux fichiers restreint
Le serveur ne lit et n'écrit que dans le projet en cours et les dossiers que vous indiquez. Les chemins qui en sortent sont refusés.
Aucune télémétrie
Statistiques, logs et rapports restent dans ~/.routeai sur votre ordinateur. Le plugin ne communique qu'avec les serveurs Ollama que vous avez configurés.
Clés et budgets
Les clés API vivent dans des variables d'environnement : jamais dans la configuration, jamais dans le chat, jamais dans un log, et les requêtes ne suivent jamais les redirections. Chaque fournisseur porte son prix et un plafond quotidien en requêtes, en tokens ou en dollars ; une fois le plafond atteint, le travail revient à vos propres machines.
Gratuit et open source, et ça le restera
RouteAI est publié sous licence MIT : utilisez-le au travail, modifiez-le, partagez-le. S'il vous a fait économiser des tokens, un petit don aide à le faire vivre.
Questions
Quels modèles utiliser ?
La configuration propose des modèles coder adaptés à chaque machine — sur un GPU de 12 GB, qwen2.5-coder:14b (environ 50 tok/s) et le mixture-of-experts qwen3-coder:30b ; sur un portable sans GPU, des modèles de 3–7B — et ne les télécharge qu'avec votre accord. Pour les fournisseurs, vous choisissez parmi les modèles qu'ils proposent. Le benchmark montre ensuite ce qui fonctionne vraiment.
Combien de tokens économise-t-on ?
Chaque tâche terminée vous le dit : les fichiers lus par le modèle plus ce qu'il a écrit, moins les consignes rédigées par Claude et le résultat que Claude a lu. Les tâches conséquentes et les lots économisent des milliers de tokens ; les toutes petites peuvent coûter plus qu'elles ne rapportent, et le rapport le dit — y compris ce qu'un fournisseur payant vous a coûté.
Que se passe-t-il si une machine est éteinte ?
Elle est marquée comme indisponible et le travail part vers les autres machines. Si aucune ne peut prendre une catégorie, l'outil le signale et Claude fait simplement la tâche lui-même.
Un portable sans GPU est-il utile ?
Oui, pour les scripts, les tests et la documentation avec de petits modèles, et en renfort quand la machine à GPU est occupée. Limitez-le à une tâche à la fois pour que votre propre travail reste fluide.
Puis-je ajouter Gemini, Groq ou OpenAI ?
Oui : /routeai:add-ai gemini gem1. N'importe quelle API compatible OpenAI convient, y compris votre propre vLLM ou LM Studio. La clé va dans une variable d'environnement, vous décidez si vos fichiers peuvent être envoyés, et vous fixez un plafond quotidien en requêtes, en tokens ou en dollars.
Est-ce un produit Anthropic ou Ollama ?
Non. C'est un projet open source indépendant, sans lien avec Anthropic ni Ollama. Il utilise les interfaces publiques de plugins et MCP de Claude Code et l'API publique d'Ollama.