Claude guida. Le tue altre AI fanno i lavori piccoli.
Con RouteAI Claude affida test unitari, script, docstring, file di build e modifiche in blocco alle AI che hai già: i modelli Ollama dei tuoi computer e le quote gratuite giornaliere di provider come Gemini, Groq o OpenRouter. Prima quello che è gratis, a pagamento solo se lo permetti, e Claude scrive le istruzioni, controlla il risultato e ha l'ultima parola.
Solo Python 3.11 e Ollama · provider API facoltativi · Windows, macOS, Linux · licenza MIT
Un team di sviluppatori junior sul tuo hardware
Un piccolo server MCP senza dipendenze, un router che impara e una skill che spiega a Claude quando conviene delegare.
Smistato per potenza e per costo
Ogni task ha una categoria. complex e code vanno prima alla macchina veloce con la GPU; tests, scripts, build e docs a quelle più lente o alla quota gratuita di un provider. Prima si usa ciò che è gratuito, e il lavoro passa altrove quando le macchine preferite sono occupate.
Impara di quale modello fidarsi
Il router ordina macchine e modelli in base a qualità e velocità misurate, compresi il tempo di caricamento del modello e la coda. I punteggi arrivano dal benchmark e dal giudizio di Claude su ogni risultato reale: buono, corretto o scartato.
La governance resta a Claude
Claude decide cosa delegare, scrive istruzioni precise, esegue i test e legge le differenze. Progettazione, codice delicato per la sicurezza e modifiche trasversali restano a Claude. Il benchmark suggerisce soltanto modifiche alla configurazione: le approvi tu.
Meno token, davvero
Il server legge da solo i file del progetto e scrive i risultati direttamente su disco, restituendo solo una breve anteprima. Claude non incolla mai un file né rilegge risposte lunghe, e ogni task riporta i token che ha fatto risparmiare.
Lavori in parallelo
Un'istruzione, quaranta file: i test per ogni modulo, una docstring per ogni funzione, la stessa migrazione ovunque. I task si distribuiscono su tutte le tue macchine insieme e finiscono dove dici tu, per esempio tests/test_{stem}.py.
Serve solo Python
Solo libreria standard: niente pip, niente SDK, niente Docker. Quando vuoi aggiungi un provider API — Gemini, Groq, OpenRouter, DeepSeek, Mistral, OpenAI o un tuo endpoint — con la chiave in una variabile d'ambiente, mai in un file.
Come si incastrano i pezzi
Claude Code parla con un piccolo server locale; il server parla con le macchine Ollama della tua rete e, se lo permetti, con i provider API che hai aggiunto.
- Router: sceglie nodo e modello per ogni task, prima il gratuito
- Qualità e velocità misurate di ogni modello
- Benchmark che si corregge da solo e conto dei token
- Claude scrive le istruzioniPoche righe precise e i percorsi dei file — mai il contenuto, così Claude non paga per leggerli.
- Il server lo smistaLegge i file, sceglie la macchina libera e il modello migliori per la categoria, e il risultato finisce direttamente su disco.
- Claude verifica e dà un votoEsegue i test, legge le differenze e segna il risultato come buono, corretto o scartato. Lo smistamento impara da ogni voto.
- Vedi quanto hai risparmiatoOgni task concluso riporta i token di Claude risparmiati e il totale della sessione. I task minuscoli possono risultare in perdita, e i numeri lo dicono.
Operativo in cinque minuti
Se Ollama gira già sui tuoi computer, hai quasi finito.
- Installa il pluginDue comandi in Claude Code aggiungono il marketplace e installano RouteAI: il server MCP, la skill di delega e i comandi
/routeai:statuse/routeai:bench. - Descrivi le tue macchine
/routeai:setupinterroga i server Ollama e scrive~/.routeai/fleet.toml;/routeai:add-aiaggiunge un provider: la chiave resta in una variabile d'ambiente e decidi tu se i tuoi file possono raggiungerlo. - Lavora come sempreQuando un piano contiene test, script o codice ripetitivo, Claude li delega, verifica ciò che torna e lo valuta. Con
/routeai:statusvedi in ogni momento dove va il lavoro e quanti token hai risparmiato.
Installazione
# in Claude Code /plugin marketplace add bdbais/routeai /plugin install routeai@bais # describe your machines: models are picked and suggested per machine /routeai:setup gpu=http://192.168.1.13:11434 local=http://localhost:11434 # let the fleet learn your hardware, then check routing and savings /routeai:bench /routeai:status
Sulle macchine diverse dalla tua avvia Ollama con OLLAMA_HOST=0.0.0.0, così è raggiungibile in rete. Il plugin trova da solo Python 3.11+ (py, python3 o python).
Un benchmark che si corregge da solo
Lancialo ogni tanto finché la flotta non conosce il tuo hardware: spesso mentre sta ancora imparando, una volta al mese quando i punteggi sono stabili. I provider a pagamento restano esclusi, a meno che tu non li chieda.
Valutato, non indovinato
Dieci task reali con controlli automatici: il codice gira contro test unitari nascosti, i test generati devono scovare bug inseriti apposta, gli script vengono eseguiti, il TOML viene analizzato, le docstring confrontate con l'AST.
Spreme il tuo hardware
Misura i token al secondo, il tempo di caricamento, quanta parte di ogni modello sta in VRAM e come cresce il throughput con richieste parallele, poi ti indica contesto e parallelismo migliori.
Consigli, non sorprese
Ogni esecuzione produce un report: il modello migliore per categoria, i modelli da togliere, un nodo più veloce che merita il livello heavy. Claude lo trasforma in una proposta di modifica a fleet.toml che approvi tu.
Sa quando fermarsi
Ogni coppia modello-categoria diventa stabile dopo cinque misure coerenti. Lo stato ti dice quando serve un nuovo giro, e nel frattempo il lavoro reale continua a raffinare i punteggi.
Il tuo codice resta nella tua rete
Delegare ha senso solo se non apre nuove falle.
Per default non esce niente dal tuo computer
I modelli locali vedono i tuoi file; un provider che hai aggiunto no, a meno che tu non imposti send_files. I modelli Ollama :cloud, che girano su ollama.com, vengono ignorati se non li autorizzi esplicitamente.
Accesso ai file confinato
Il server legge e scrive solo dentro il progetto corrente e le cartelle che indichi. I percorsi che ne escono vengono rifiutati.
Nessuna telemetria
Statistiche, log e report restano in ~/.routeai sul tuo computer. Il plugin parla solo con i server Ollama che hai configurato.
Chiavi e budget
Le chiavi API stanno in variabili d'ambiente: mai nella configurazione, mai in chat, mai nei log, e le richieste non seguono mai i redirect. Ogni provider porta con sé il proprio prezzo e un tetto giornaliero in richieste, token o dollari; raggiunto il tetto, il lavoro torna alle tue macchine.
Gratis e open source, e tale resterà
RouteAI è rilasciato con licenza MIT: usalo al lavoro, modificalo, condividilo. Se ti ha fatto risparmiare token, una piccola donazione aiuta a portarlo avanti.
Domande
Quali modelli conviene usare?
Il setup suggerisce modelli coder adatti a ogni macchina — su una GPU da 12 GB qwen2.5-coder:14b (circa 50 tok/s) e il mixture-of-experts qwen3-coder:30b, su un portatile senza GPU modelli da 3–7B — e li scarica solo col tuo consenso. Per i provider scegli tra i modelli che offrono. Poi il benchmark mostra cosa funziona davvero.
Quanti token si risparmiano?
Te lo dice ogni task concluso: i file letti dal modello più quello che ha scritto, meno le istruzioni scritte da Claude e il risultato che Claude ha letto. Task corposi e lavori in blocco fanno risparmiare migliaia di token; quelli minuscoli possono costare più di quanto risparmiano, e il resoconto lo dice, incluso quanto ti è costato un provider a pagamento.
Cosa succede se una macchina è spenta?
Viene segnata come non disponibile e il lavoro va alle altre. Se nessuna può gestire una categoria, lo strumento lo segnala e Claude fa il task da solo.
Un portatile senza GPU serve a qualcosa?
Sì, per script, test e documentazione con modelli piccoli, e come riserva quando la macchina con la GPU è occupata. Tienilo a un task alla volta, così il tuo lavoro resta fluido.
Posso aggiungere Gemini, Groq o OpenAI?
Sì: /routeai:add-ai gemini gem1. Va bene qualsiasi API compatibile con OpenAI, compresi un tuo vLLM o LM Studio. La chiave va in una variabile d'ambiente, decidi tu se i tuoi file possono essere inviati, e imposti un tetto giornaliero in richieste, token o dollari.
È un prodotto Anthropic o Ollama?
No. È un progetto open source indipendente, non affiliato ad Anthropic né a Ollama. Usa le interfacce pubbliche di plugin e MCP di Claude Code e l'API pubblica di Ollama.