Plugin für Claude Code · Kostenlos · Open Source

Claude führt. Ihre anderen KIs erledigen die kleinen Aufgaben.

Mit RouteAI übergibt Claude Unit-Tests, Skripte, Docstrings, Build-Dateien und Massenänderungen an die KIs, die Sie schon haben: die Ollama-Modelle auf Ihren Rechnern und die kostenlosen Tageskontingente von Anbietern wie Gemini, Groq oder OpenRouter. Zuerst das Kostenlose, kostenpflichtig nur, wenn Sie es erlauben — und Claude schreibt die Aufgabenbeschreibung, prüft das Ergebnis und behält das letzte Wort.

Nur Python 3.11 und Ollama · API-Anbieter optional · Windows, macOS, Linux · MIT-Lizenz

Ein Team von Junior-Entwicklern auf Ihrer eigenen Hardware

Ein kleiner MCP-Server ohne Abhängigkeiten, ein lernfähiges Routing und ein Skill, der Claude sagt, wann sich das Delegieren lohnt.

Verteilt nach Rechenleistung und Kosten

Jede Aufgabe hat eine Kategorie. complex und code gehen zuerst an den schnellen GPU-Rechner, tests, scripts, build und docs an die langsameren oder an das kostenlose Kontingent eines Anbieters. Kostenloses wird vor Kostenpflichtigem genutzt, und die Arbeit weicht aus, wenn die bevorzugten Rechner ausgelastet sind.

Lernt, welchem Modell zu trauen ist

Der Router bewertet Rechner und Modelle nach gemessener Qualität und Geschwindigkeit — einschließlich Ladezeit des Modells und Warteschlange. Die Werte stammen aus dem Benchmark und aus Claudes Bewertung jedes echten Ergebnisses als gut, korrigiert oder abgelehnt.

Claude behält die Governance

Claude entscheidet, was delegiert wird, schreibt eine präzise Aufgabenbeschreibung, führt die Tests aus und liest den Diff. Architektur, sicherheitskritischer Code und übergreifende Änderungen bleiben bei Claude. Der Benchmark schlägt Konfigurationsänderungen nur vor; freigeben müssen Sie sie.

Wirklich weniger Tokens

Der Server liest Ihre Projektdateien selbst und schreibt Ergebnisse direkt auf die Festplatte, sodass nur eine kurze Vorschau zurückkommt. Claude fügt nie eine Datei ein und liest nie eine lange Antwort zurück, und jede Aufgabe meldet die Tokens, die sie gespart hat.

Parallele Batches

Eine Anweisung, vierzig Dateien: Tests für jedes Modul, ein Docstring für jede Funktion, dieselbe Migration überall. Die Aufgaben verteilen sich gleichzeitig auf alle Ihre Rechner und landen dort, wo Sie es vorgeben, z. B. tests/test_{stem}.py.

Außer Python nichts zu installieren

Reine Standardbibliothek: kein pip, kein SDK, kein Docker. Fügen Sie jederzeit einen API-Anbieter hinzu — Gemini, Groq, OpenRouter, DeepSeek, Mistral, OpenAI oder Ihren eigenen Endpunkt — mit dem Schlüssel in einer Umgebungsvariablen, nie in einer Datei.

Wie die Teile zusammenspielen

Claude Code spricht mit einem kleinen lokalen Server; der Server spricht mit den Ollama-Rechnern in Ihrem Netzwerk und, wenn Sie es erlauben, mit den API-Anbietern, die Sie hinzugefügt haben.

Claude CodeEntscheidet, was delegiert wird, schreibt die Aufgabenbeschreibung, prüft das Ergebnis und behält das letzte Wort.
routeaiEin Python-Prozess ohne Abhängigkeiten, vom Plugin gestartet.
  • Router: wählt Knoten und Modell für jede Aufgabe, Kostenloses zuerst
  • Gelernte Qualität und Geschwindigkeit jedes Modells
  • Selbstbewertender Benchmark und Token-Bilanz
Desktop mit GPUcomplex · code
Laptop (CPU)tests · scripts · build · docs
API-Anbieteroptional: zuerst die Gratis-Kontingente, kostenpflichtig nur mit Budget
Gemieteter Serveroptional, hinter einem VPN
  1. Claude beschreibt die AufgabeEin paar präzise Zeilen und die Dateipfade — nie die Dateiinhalte, damit Claude nicht dafür bezahlt, sie zu lesen.
  2. Der Server verteilt sieEr liest die Dateien, wählt den besten freien Rechner und das beste Modell für die Kategorie, und das Ergebnis wird direkt auf die Festplatte geschrieben.
  3. Claude prüft und bewertetClaude führt die Tests aus, liest den Diff und bewertet das Ergebnis als gut, korrigiert oder abgelehnt. Das Routing lernt aus jeder Bewertung.
  4. Sie sehen, was Sie gespart habenJede abgeschlossene Aufgabe meldet die gesparten Claude-Tokens und die Summe der Sitzung. Winzige Aufgaben können negativ ausfallen, und die Zahlen sagen das auch.

In fünf Minuten startklar

Wenn Ollama bereits auf Ihren Rechnern läuft, sind Sie fast fertig.

  1. Plugin installierenZwei Befehle in Claude Code fügen den Marketplace hinzu und installieren RouteAI: den MCP-Server, den Delegations-Skill und die Befehle /routeai:status und /routeai:bench.
  2. Rechner beschreiben/routeai:setup fragt jeden Ollama-Server ab und schreibt ~/.routeai/fleet.toml; /routeai:add-ai fügt einen Anbieter hinzu — sein Schlüssel bleibt in einer Umgebungsvariablen, und Sie entscheiden, ob Ihre Dateien zu ihm gelangen dürfen.
  3. Wie gewohnt arbeitenEnthält ein Plan Tests, Skripte oder Boilerplate, delegiert Claude diese, prüft das Ergebnis und bewertet es. Mit /routeai:status sehen Sie jederzeit, wohin die Arbeit geht und wie viele Tokens gespart wurden.

Installation

# in Claude Code
/plugin marketplace add bdbais/routeai
/plugin install routeai@bais

# describe your machines: models are picked and suggested per machine
/routeai:setup gpu=http://192.168.1.13:11434 local=http://localhost:11434

# let the fleet learn your hardware, then check routing and savings
/routeai:bench
/routeai:status

Starten Sie Ollama auf anderen Rechnern als Ihrem eigenen mit OLLAMA_HOST=0.0.0.0, damit es im Netzwerk erreichbar ist. Das Plugin findet Python 3.11+ selbst (py, python3 oder python).

Ein Benchmark, der sich selbst bewertet

Führen Sie ihn ab und zu aus, bis die Flotte Ihre Hardware kennt: häufig, solange sie noch lernt, monatlich, sobald die Werte stabil sind. Kostenpflichtige Anbieter bleiben außen vor, sofern Sie sie nicht ausdrücklich einbeziehen.

Gemessen, nicht geraten

Zehn echte Aufgaben mit automatischen Prüfungen: Code läuft gegen versteckte Unit-Tests, generierte Tests müssen absichtlich eingebaute Bugs finden, Skripte werden ausgeführt, TOML wird geparst, Docstrings werden mit dem AST abgeglichen.

Holt alles aus Ihrer Hardware

Er misst Tokens pro Sekunde, Ladezeiten der Modelle, wie viel von jedem Modell in den VRAM passt und wie der Durchsatz mit parallelen Anfragen wächst — und nennt Ihnen dann die Kontextgröße und Parallelität, die am besten funktionieren.

Empfehlungen statt Überraschungen

Jeder Lauf erzeugt einen Bericht: das beste Modell pro Kategorie, Modelle, die weg können, einen schnelleren Knoten, der die Heavy-Stufe verdient. Claude macht daraus eine vorgeschlagene Änderung an fleet.toml, die Sie freigeben.

Weiß, wann Schluss ist

Jedes Paar aus Modell und Kategorie gilt nach fünf konsistenten Messungen als stabil. Der Status zeigt, wann ein neuer Lauf fällig ist, und dazwischen verfeinert die echte Arbeit die Werte weiter.

Ihr Code bleibt in Ihrem Netzwerk

Delegieren lohnt sich nur, wenn es keine neuen Lücken aufreißt.

Standardmäßig verlässt nichts Ihren Rechner

Lokale Modelle sehen Ihre Dateien; ein von Ihnen hinzugefügter Anbieter nicht, sofern Sie für ihn nicht send_files setzen. Ollama-Modelle mit :cloud, die auf ollama.com laufen, werden ignoriert, sofern Sie sie nicht ausdrücklich erlauben.

Eingeschränkter Dateizugriff

Der Server liest und schreibt nur im aktuellen Projekt und in den Ordnern, die Sie angeben. Pfade, die daraus hinausführen, werden abgelehnt.

Keine Telemetrie

Statistiken, Logs und Berichte bleiben in ~/.routeai auf Ihrem Rechner. Das Plugin kommuniziert nur mit den Ollama-Servern, die Sie konfiguriert haben.

Schlüssel und Budgets

API-Schlüssel liegen in Umgebungsvariablen: nie in der Konfiguration, nie im Chat, nie in einem Log, und Anfragen folgen niemals Weiterleitungen. Jeder Anbieter bringt seinen Preis und ein Tageslimit in Anfragen, Tokens oder Dollar mit; ist das Limit erreicht, geht die Arbeit zurück an Ihre eigenen Rechner.

Kostenlos und Open Source, und das bleibt so

RouteAI steht unter der MIT-Lizenz: Nutzen Sie es bei der Arbeit, ändern Sie es, teilen Sie es. Wenn es Ihnen Tokens gespart hat, hilft eine kleine Spende, es weiterzuentwickeln.

Fragen

Welche Modelle sollte ich verwenden?

Das Setup schlägt Coder-Modelle vor, die zu jedem Rechner passen — auf einer GPU mit 12 GB qwen2.5-coder:14b (etwa 50 tok/s) und das Mixture-of-Experts-Modell qwen3-coder:30b, auf einem Laptop ohne GPU Modelle mit 3–7B — und lädt sie nur mit Ihrer Zustimmung herunter. Bei Anbietern wählen Sie aus den Modellen, die sie anbieten. Der Benchmark zeigt dann, was wirklich funktioniert.

Wie viele Tokens spart es?

Das meldet jede abgeschlossene Aufgabe: die vom Modell gelesenen Dateien plus das, was es geschrieben hat, abzüglich der Aufgabenbeschreibung von Claude und des Ergebnisses, das Claude gelesen hat. Umfangreiche Aufgaben und Batches sparen Tausende Tokens; winzige können mehr kosten, als sie sparen, und der Bericht sagt das auch — einschließlich dessen, was ein kostenpflichtiger Anbieter Sie gekostet hat.

Was passiert, wenn ein Rechner ausgeschaltet ist?

Er wird als nicht verfügbar markiert, und die Arbeit geht an die anderen Rechner. Kann keiner eine Kategorie übernehmen, meldet das Tool dies, und Claude erledigt die Aufgabe einfach selbst.

Lohnt sich ein Laptop ohne GPU?

Ja, für Skripte, Tests und Dokumentation mit kleinen Modellen und als Reserve, wenn der GPU-Rechner ausgelastet ist. Lassen Sie darauf nur eine Aufgabe gleichzeitig laufen, damit Ihre eigene Arbeit flüssig bleibt.

Kann ich Gemini, Groq oder OpenAI hinzufügen?

Ja: /routeai:add-ai gemini gem1. Jede OpenAI-kompatible API funktioniert, auch Ihr eigenes vLLM oder LM Studio. Der Schlüssel kommt in eine Umgebungsvariable, Sie entscheiden, ob Ihre Dateien gesendet werden dürfen, und Sie setzen ein Tageslimit in Anfragen, Tokens oder Dollar.

Ist es ein Produkt von Anthropic oder Ollama?

Nein. Es ist ein unabhängiges Open-Source-Projekt, das weder mit Anthropic noch mit Ollama verbunden ist. Es nutzt die öffentlichen Plugin- und MCP-Schnittstellen von Claude Code und die öffentliche API von Ollama.