Plugin para Claude Code · Gratuito · Código aberto

O Claude lidera. Suas outras IAs fazem as tarefas pequenas.

Com o RouteAI, o Claude passa testes unitários, scripts, docstrings, arquivos de build e edições em massa para as IAs que você já tem: os modelos do Ollama nos seus computadores e as cotas gratuitas diárias de provedores como Gemini, Groq ou OpenRouter. Primeiro o que é gratuito, pago só se você permitir, e o Claude escreve as instruções, confere o resultado e dá a palavra final.

Só Python 3.11 e Ollama · provedores de API opcionais · Windows, macOS, Linux · licença MIT

Uma equipe de desenvolvedores júnior no seu próprio hardware

Um pequeno servidor MCP sem dependências, um roteador que aprende e uma skill que diz ao Claude quando vale a pena delegar.

Distribuído por potência e por custo

Cada tarefa tem uma categoria. complex e code vão primeiro para a máquina rápida com GPU; tests, scripts, build e docs para as mais lentas ou para a cota gratuita de um provedor. O que é gratuito vem antes do pago, e o trabalho transborda quando as máquinas preferidas estão ocupadas.

Aprende em qual modelo confiar

O roteador classifica máquinas e modelos pela qualidade e velocidade medidas — incluindo o tempo de carregamento do modelo e a fila. As notas vêm do benchmark e da avaliação do Claude sobre cada resultado real: bom, corrigido ou rejeitado.

O Claude mantém a governança

O Claude decide o que delegar, escreve instruções precisas, roda os testes e lê o diff. Design, código sensível à segurança e mudanças transversais ficam com o Claude. O benchmark apenas sugere mudanças de configuração; quem aprova é você.

Menos tokens, de verdade

O servidor lê sozinho os arquivos do seu projeto e grava os resultados direto no disco, devolvendo só uma prévia curta. O Claude nunca cola um arquivo nem relê uma resposta longa, e cada tarefa informa os tokens que economizou.

Lotes em paralelo

Uma instrução, quarenta arquivos: testes para cada módulo, uma docstring em cada função, a mesma migração em todo lugar. As tarefas se espalham por todas as suas máquinas ao mesmo tempo e vão parar onde você indicar, por exemplo tests/test_{stem}.py.

Nada para instalar além do Python

Só a biblioteca padrão: sem pip, sem SDK, sem Docker. Adicione um provedor de API quando quiser — Gemini, Groq, OpenRouter, DeepSeek, Mistral, OpenAI ou o seu próprio endpoint — com a chave em uma variável de ambiente, nunca em um arquivo.

Como as peças se encaixam

O Claude Code conversa com um pequeno servidor local; o servidor conversa com as máquinas Ollama da sua rede e, se você permitir, com os provedores de API que você adicionou.

Claude CodeDecide o que delegar, escreve as instruções, verifica o resultado e dá a palavra final.
routeaiUm processo Python sem dependências, iniciado pelo plugin.
  • Roteador: escolhe o nó e o modelo para cada tarefa, o gratuito primeiro
  • Qualidade e velocidade aprendidas de cada modelo
  • Benchmark que se autoavalia e contagem de tokens
Desktop com GPUcomplex · code
Notebook (CPU)tests · scripts · build · docs
Provedores de APIopcional: primeiro as cotas gratuitas, pago só com um limite
Servidor alugadoopcional, atrás de uma VPN
  1. O Claude escreve as instruçõesAlgumas linhas precisas e os caminhos dos arquivos — nunca o conteúdo, assim o Claude não paga para lê-los.
  2. O servidor faz o roteamentoEle lê os arquivos, escolhe a melhor máquina livre e o melhor modelo para a categoria, e o resultado é gravado direto no disco.
  3. O Claude verifica e avaliaEle roda os testes, lê o diff e marca o resultado como bom, corrigido ou rejeitado. O roteamento aprende com cada avaliação.
  4. Você vê quanto economizouCada tarefa concluída informa os tokens do Claude economizados e o total da sessão. Tarefas minúsculas podem sair no negativo, e os números mostram isso.

Rodando em cinco minutos

Se o Ollama já roda nas suas máquinas, você está quase lá.

  1. Instale o pluginDois comandos no Claude Code adicionam o marketplace e instalam o RouteAI: o servidor MCP, a skill de delegação e os comandos /routeai:status e /routeai:bench.
  2. Descreva suas máquinas/routeai:setup consulta cada servidor Ollama e grava ~/.routeai/fleet.toml; /routeai:add-ai adiciona um provedor: a chave dele fica em uma variável de ambiente e você decide se os seus arquivos podem chegar até ele.
  3. Trabalhe como sempreQuando um plano inclui testes, scripts ou boilerplate, o Claude os delega, verifica o que volta e avalia o resultado. Use /routeai:status a qualquer momento para ver para onde vai o trabalho e quantos tokens foram economizados.

Instalação

# in Claude Code
/plugin marketplace add bdbais/routeai
/plugin install routeai@bais

# describe your machines: models are picked and suggested per machine
/routeai:setup gpu=http://192.168.1.13:11434 local=http://localhost:11434

# let the fleet learn your hardware, then check routing and savings
/routeai:bench
/routeai:status

Nas máquinas que não forem a sua, inicie o Ollama com OLLAMA_HOST=0.0.0.0 para que ele escute na sua rede. O plugin encontra o Python 3.11+ sozinho (py, python3 ou python).

Um benchmark que se avalia sozinho

Rode de vez em quando até a frota conhecer o seu hardware: com frequência enquanto ainda está aprendendo, uma vez por mês quando as notas estiverem estáveis. Os provedores pagos ficam de fora, a menos que você peça.

Avaliado, não adivinhado

Dez tarefas reais com verificações automáticas: o código roda contra testes unitários ocultos, os testes gerados precisam pegar bugs plantados de propósito, os scripts são executados, o TOML é analisado e as docstrings são comparadas com a AST.

Espreme o seu hardware

Mede tokens por segundo, tempo de carregamento do modelo, quanto de cada modelo cabe na VRAM e como o throughput cresce com requisições paralelas — e depois indica o tamanho de contexto e o paralelismo que funcionam melhor.

Recomendações, não surpresas

Cada execução gera um relatório: o melhor modelo por categoria, os modelos a descartar, um nó mais rápido que merece o nível heavy. O Claude transforma isso numa proposta de mudança no fleet.toml para você aprovar.

Sabe quando parar

Cada par de modelo e categoria fica estável após cinco amostras consistentes. O status avisa quando é hora de uma nova execução, e nesse meio-tempo o trabalho real continua refinando as notas.

Seu código fica na sua rede

Delegar só vale a pena se não abrir novas brechas.

Por padrão, nada sai da sua máquina

Os modelos locais veem os seus arquivos; um provedor que você adicionou não vê, a menos que você defina send_files para ele. Os modelos :cloud do Ollama, que rodam no ollama.com, são ignorados se você não os autorizar explicitamente.

Acesso a arquivos restrito

O servidor lê e grava apenas dentro do projeto atual e das pastas que você indicar. Caminhos que saem dali são recusados.

Sem telemetria

Estatísticas, logs e relatórios ficam em ~/.routeai no seu computador. O plugin só se comunica com os servidores Ollama que você configurou.

Chaves e orçamentos

As chaves de API ficam em variáveis de ambiente: nunca na configuração, nunca no chat, nunca em um log, e as requisições nunca seguem redirecionamentos. Cada provedor carrega o próprio preço e um limite diário em requisições, tokens ou dólares; atingido o limite, o trabalho volta para as suas máquinas.

Gratuito e de código aberto, e vai continuar assim

O RouteAI é distribuído sob a licença MIT: use no trabalho, modifique, compartilhe. Se ele economizou tokens para você, uma pequena doação ajuda a mantê-lo.

Perguntas

Quais modelos devo usar?

A configuração sugere modelos coder adequados a cada máquina — numa GPU de 12 GB, qwen2.5-coder:14b (cerca de 50 tok/s) e o mixture-of-experts qwen3-coder:30b; num notebook só com CPU, modelos de 3–7B — e só os baixa com a sua aprovação. Para os provedores, você escolhe entre os modelos que eles oferecem. Depois, o benchmark mostra o que realmente funciona.

Quantos tokens ele economiza?

Cada tarefa concluída informa: os arquivos que o modelo leu mais o que ele escreveu, menos as instruções que o Claude escreveu e o resultado que o Claude leu. Tarefas maiores e lotes economizam milhares de tokens; as minúsculas podem custar mais do que economizam, e o relatório mostra isso, incluindo quanto um provedor pago custou a você.

O que acontece se uma máquina estiver desligada?

Ela é marcada como indisponível e o trabalho vai para as outras máquinas. Se nenhuma puder assumir uma categoria, a ferramenta avisa e o Claude simplesmente faz a tarefa ele mesmo.

Um notebook sem GPU é útil?

Sim, para scripts, testes e documentação com modelos pequenos, e como reserva quando a máquina com GPU está ocupada. Deixe uma tarefa por vez nele para que o seu próprio trabalho continue fluido.

Posso adicionar Gemini, Groq ou OpenAI?

Sim: /routeai:add-ai gemini gem1. Qualquer API compatível com OpenAI funciona, incluindo o seu próprio vLLM ou LM Studio. A chave vai em uma variável de ambiente, você decide se os seus arquivos podem ser enviados e define um limite diário em requisições, tokens ou dólares.

É um produto da Anthropic ou do Ollama?

Não. É um projeto independente de código aberto, sem afiliação com a Anthropic nem com o Ollama. Ele usa as interfaces públicas de plugins e MCP do Claude Code e a API pública do Ollama.