Plugin per Claude Code · Gratis · Open source

Claude guida. Le tue altre AI fanno i lavori piccoli.

Con RouteAI Claude affida test unitari, script, docstring, file di build e modifiche in blocco alle AI che hai già: i modelli Ollama dei tuoi computer e le quote gratuite giornaliere di provider come Gemini, Groq o OpenRouter. Prima quello che è gratis, a pagamento solo se lo permetti, e Claude scrive le istruzioni, controlla il risultato e ha l'ultima parola.

Solo Python 3.11 e Ollama · provider API facoltativi · Windows, macOS, Linux · licenza MIT

Un team di sviluppatori junior sul tuo hardware

Un piccolo server MCP senza dipendenze, un router che impara e una skill che spiega a Claude quando conviene delegare.

Smistato per potenza e per costo

Ogni task ha una categoria. complex e code vanno prima alla macchina veloce con la GPU; tests, scripts, build e docs a quelle più lente o alla quota gratuita di un provider. Prima si usa ciò che è gratuito, e il lavoro passa altrove quando le macchine preferite sono occupate.

Impara di quale modello fidarsi

Il router ordina macchine e modelli in base a qualità e velocità misurate, compresi il tempo di caricamento del modello e la coda. I punteggi arrivano dal benchmark e dal giudizio di Claude su ogni risultato reale: buono, corretto o scartato.

La governance resta a Claude

Claude decide cosa delegare, scrive istruzioni precise, esegue i test e legge le differenze. Progettazione, codice delicato per la sicurezza e modifiche trasversali restano a Claude. Il benchmark suggerisce soltanto modifiche alla configurazione: le approvi tu.

Meno token, davvero

Il server legge da solo i file del progetto e scrive i risultati direttamente su disco, restituendo solo una breve anteprima. Claude non incolla mai un file né rilegge risposte lunghe, e ogni task riporta i token che ha fatto risparmiare.

Lavori in parallelo

Un'istruzione, quaranta file: i test per ogni modulo, una docstring per ogni funzione, la stessa migrazione ovunque. I task si distribuiscono su tutte le tue macchine insieme e finiscono dove dici tu, per esempio tests/test_{stem}.py.

Serve solo Python

Solo libreria standard: niente pip, niente SDK, niente Docker. Quando vuoi aggiungi un provider API — Gemini, Groq, OpenRouter, DeepSeek, Mistral, OpenAI o un tuo endpoint — con la chiave in una variabile d'ambiente, mai in un file.

Come si incastrano i pezzi

Claude Code parla con un piccolo server locale; il server parla con le macchine Ollama della tua rete e, se lo permetti, con i provider API che hai aggiunto.

Claude CodeDecide cosa delegare, scrive le istruzioni, verifica il risultato e ha l'ultima parola.
routeaiUn processo Python senza dipendenze, avviato dal plugin.
  • Router: sceglie nodo e modello per ogni task, prima il gratuito
  • Qualità e velocità misurate di ogni modello
  • Benchmark che si corregge da solo e conto dei token
Desktop con GPUcomplex · code
Portatile (CPU)tests · scripts · build · docs
Provider APIfacoltativi: prima le quote gratuite, a pagamento solo con un tetto
Server a noleggiofacoltativo, dietro una VPN
  1. Claude scrive le istruzioniPoche righe precise e i percorsi dei file — mai il contenuto, così Claude non paga per leggerli.
  2. Il server lo smistaLegge i file, sceglie la macchina libera e il modello migliori per la categoria, e il risultato finisce direttamente su disco.
  3. Claude verifica e dà un votoEsegue i test, legge le differenze e segna il risultato come buono, corretto o scartato. Lo smistamento impara da ogni voto.
  4. Vedi quanto hai risparmiatoOgni task concluso riporta i token di Claude risparmiati e il totale della sessione. I task minuscoli possono risultare in perdita, e i numeri lo dicono.

Operativo in cinque minuti

Se Ollama gira già sui tuoi computer, hai quasi finito.

  1. Installa il pluginDue comandi in Claude Code aggiungono il marketplace e installano RouteAI: il server MCP, la skill di delega e i comandi /routeai:status e /routeai:bench.
  2. Descrivi le tue macchine/routeai:setup interroga i server Ollama e scrive ~/.routeai/fleet.toml; /routeai:add-ai aggiunge un provider: la chiave resta in una variabile d'ambiente e decidi tu se i tuoi file possono raggiungerlo.
  3. Lavora come sempreQuando un piano contiene test, script o codice ripetitivo, Claude li delega, verifica ciò che torna e lo valuta. Con /routeai:status vedi in ogni momento dove va il lavoro e quanti token hai risparmiato.

Installazione

# in Claude Code
/plugin marketplace add bdbais/routeai
/plugin install routeai@bais

# describe your machines: models are picked and suggested per machine
/routeai:setup gpu=http://192.168.1.13:11434 local=http://localhost:11434

# let the fleet learn your hardware, then check routing and savings
/routeai:bench
/routeai:status

Sulle macchine diverse dalla tua avvia Ollama con OLLAMA_HOST=0.0.0.0, così è raggiungibile in rete. Il plugin trova da solo Python 3.11+ (py, python3 o python).

Un benchmark che si corregge da solo

Lancialo ogni tanto finché la flotta non conosce il tuo hardware: spesso mentre sta ancora imparando, una volta al mese quando i punteggi sono stabili. I provider a pagamento restano esclusi, a meno che tu non li chieda.

Valutato, non indovinato

Dieci task reali con controlli automatici: il codice gira contro test unitari nascosti, i test generati devono scovare bug inseriti apposta, gli script vengono eseguiti, il TOML viene analizzato, le docstring confrontate con l'AST.

Spreme il tuo hardware

Misura i token al secondo, il tempo di caricamento, quanta parte di ogni modello sta in VRAM e come cresce il throughput con richieste parallele, poi ti indica contesto e parallelismo migliori.

Consigli, non sorprese

Ogni esecuzione produce un report: il modello migliore per categoria, i modelli da togliere, un nodo più veloce che merita il livello heavy. Claude lo trasforma in una proposta di modifica a fleet.toml che approvi tu.

Sa quando fermarsi

Ogni coppia modello-categoria diventa stabile dopo cinque misure coerenti. Lo stato ti dice quando serve un nuovo giro, e nel frattempo il lavoro reale continua a raffinare i punteggi.

Il tuo codice resta nella tua rete

Delegare ha senso solo se non apre nuove falle.

Per default non esce niente dal tuo computer

I modelli locali vedono i tuoi file; un provider che hai aggiunto no, a meno che tu non imposti send_files. I modelli Ollama :cloud, che girano su ollama.com, vengono ignorati se non li autorizzi esplicitamente.

Accesso ai file confinato

Il server legge e scrive solo dentro il progetto corrente e le cartelle che indichi. I percorsi che ne escono vengono rifiutati.

Nessuna telemetria

Statistiche, log e report restano in ~/.routeai sul tuo computer. Il plugin parla solo con i server Ollama che hai configurato.

Chiavi e budget

Le chiavi API stanno in variabili d'ambiente: mai nella configurazione, mai in chat, mai nei log, e le richieste non seguono mai i redirect. Ogni provider porta con sé il proprio prezzo e un tetto giornaliero in richieste, token o dollari; raggiunto il tetto, il lavoro torna alle tue macchine.

Gratis e open source, e tale resterà

RouteAI è rilasciato con licenza MIT: usalo al lavoro, modificalo, condividilo. Se ti ha fatto risparmiare token, una piccola donazione aiuta a portarlo avanti.

Domande

Quali modelli conviene usare?

Il setup suggerisce modelli coder adatti a ogni macchina — su una GPU da 12 GB qwen2.5-coder:14b (circa 50 tok/s) e il mixture-of-experts qwen3-coder:30b, su un portatile senza GPU modelli da 3–7B — e li scarica solo col tuo consenso. Per i provider scegli tra i modelli che offrono. Poi il benchmark mostra cosa funziona davvero.

Quanti token si risparmiano?

Te lo dice ogni task concluso: i file letti dal modello più quello che ha scritto, meno le istruzioni scritte da Claude e il risultato che Claude ha letto. Task corposi e lavori in blocco fanno risparmiare migliaia di token; quelli minuscoli possono costare più di quanto risparmiano, e il resoconto lo dice, incluso quanto ti è costato un provider a pagamento.

Cosa succede se una macchina è spenta?

Viene segnata come non disponibile e il lavoro va alle altre. Se nessuna può gestire una categoria, lo strumento lo segnala e Claude fa il task da solo.

Un portatile senza GPU serve a qualcosa?

Sì, per script, test e documentazione con modelli piccoli, e come riserva quando la macchina con la GPU è occupata. Tienilo a un task alla volta, così il tuo lavoro resta fluido.

Posso aggiungere Gemini, Groq o OpenAI?

Sì: /routeai:add-ai gemini gem1. Va bene qualsiasi API compatibile con OpenAI, compresi un tuo vLLM o LM Studio. La chiave va in una variabile d'ambiente, decidi tu se i tuoi file possono essere inviati, e imposti un tetto giornaliero in richieste, token o dollari.

È un prodotto Anthropic o Ollama?

No. È un progetto open source indipendente, non affiliato ad Anthropic né a Ollama. Usa le interfacce pubbliche di plugin e MCP di Claude Code e l'API pubblica di Ollama.