O Claude lidera. Suas outras IAs fazem as tarefas pequenas.
Com o RouteAI, o Claude passa testes unitários, scripts, docstrings, arquivos de build e edições em massa para as IAs que você já tem: os modelos do Ollama nos seus computadores e as cotas gratuitas diárias de provedores como Gemini, Groq ou OpenRouter. Primeiro o que é gratuito, pago só se você permitir, e o Claude escreve as instruções, confere o resultado e dá a palavra final.
Só Python 3.11 e Ollama · provedores de API opcionais · Windows, macOS, Linux · licença MIT
Uma equipe de desenvolvedores júnior no seu próprio hardware
Um pequeno servidor MCP sem dependências, um roteador que aprende e uma skill que diz ao Claude quando vale a pena delegar.
Distribuído por potência e por custo
Cada tarefa tem uma categoria. complex e code vão primeiro para a máquina rápida com GPU; tests, scripts, build e docs para as mais lentas ou para a cota gratuita de um provedor. O que é gratuito vem antes do pago, e o trabalho transborda quando as máquinas preferidas estão ocupadas.
Aprende em qual modelo confiar
O roteador classifica máquinas e modelos pela qualidade e velocidade medidas — incluindo o tempo de carregamento do modelo e a fila. As notas vêm do benchmark e da avaliação do Claude sobre cada resultado real: bom, corrigido ou rejeitado.
O Claude mantém a governança
O Claude decide o que delegar, escreve instruções precisas, roda os testes e lê o diff. Design, código sensível à segurança e mudanças transversais ficam com o Claude. O benchmark apenas sugere mudanças de configuração; quem aprova é você.
Menos tokens, de verdade
O servidor lê sozinho os arquivos do seu projeto e grava os resultados direto no disco, devolvendo só uma prévia curta. O Claude nunca cola um arquivo nem relê uma resposta longa, e cada tarefa informa os tokens que economizou.
Lotes em paralelo
Uma instrução, quarenta arquivos: testes para cada módulo, uma docstring em cada função, a mesma migração em todo lugar. As tarefas se espalham por todas as suas máquinas ao mesmo tempo e vão parar onde você indicar, por exemplo tests/test_{stem}.py.
Nada para instalar além do Python
Só a biblioteca padrão: sem pip, sem SDK, sem Docker. Adicione um provedor de API quando quiser — Gemini, Groq, OpenRouter, DeepSeek, Mistral, OpenAI ou o seu próprio endpoint — com a chave em uma variável de ambiente, nunca em um arquivo.
Como as peças se encaixam
O Claude Code conversa com um pequeno servidor local; o servidor conversa com as máquinas Ollama da sua rede e, se você permitir, com os provedores de API que você adicionou.
- Roteador: escolhe o nó e o modelo para cada tarefa, o gratuito primeiro
- Qualidade e velocidade aprendidas de cada modelo
- Benchmark que se autoavalia e contagem de tokens
- O Claude escreve as instruçõesAlgumas linhas precisas e os caminhos dos arquivos — nunca o conteúdo, assim o Claude não paga para lê-los.
- O servidor faz o roteamentoEle lê os arquivos, escolhe a melhor máquina livre e o melhor modelo para a categoria, e o resultado é gravado direto no disco.
- O Claude verifica e avaliaEle roda os testes, lê o diff e marca o resultado como bom, corrigido ou rejeitado. O roteamento aprende com cada avaliação.
- Você vê quanto economizouCada tarefa concluída informa os tokens do Claude economizados e o total da sessão. Tarefas minúsculas podem sair no negativo, e os números mostram isso.
Rodando em cinco minutos
Se o Ollama já roda nas suas máquinas, você está quase lá.
- Instale o pluginDois comandos no Claude Code adicionam o marketplace e instalam o RouteAI: o servidor MCP, a skill de delegação e os comandos
/routeai:statuse/routeai:bench. - Descreva suas máquinas
/routeai:setupconsulta cada servidor Ollama e grava~/.routeai/fleet.toml;/routeai:add-aiadiciona um provedor: a chave dele fica em uma variável de ambiente e você decide se os seus arquivos podem chegar até ele. - Trabalhe como sempreQuando um plano inclui testes, scripts ou boilerplate, o Claude os delega, verifica o que volta e avalia o resultado. Use
/routeai:statusa qualquer momento para ver para onde vai o trabalho e quantos tokens foram economizados.
Instalação
# in Claude Code /plugin marketplace add bdbais/routeai /plugin install routeai@bais # describe your machines: models are picked and suggested per machine /routeai:setup gpu=http://192.168.1.13:11434 local=http://localhost:11434 # let the fleet learn your hardware, then check routing and savings /routeai:bench /routeai:status
Nas máquinas que não forem a sua, inicie o Ollama com OLLAMA_HOST=0.0.0.0 para que ele escute na sua rede. O plugin encontra o Python 3.11+ sozinho (py, python3 ou python).
Um benchmark que se avalia sozinho
Rode de vez em quando até a frota conhecer o seu hardware: com frequência enquanto ainda está aprendendo, uma vez por mês quando as notas estiverem estáveis. Os provedores pagos ficam de fora, a menos que você peça.
Avaliado, não adivinhado
Dez tarefas reais com verificações automáticas: o código roda contra testes unitários ocultos, os testes gerados precisam pegar bugs plantados de propósito, os scripts são executados, o TOML é analisado e as docstrings são comparadas com a AST.
Espreme o seu hardware
Mede tokens por segundo, tempo de carregamento do modelo, quanto de cada modelo cabe na VRAM e como o throughput cresce com requisições paralelas — e depois indica o tamanho de contexto e o paralelismo que funcionam melhor.
Recomendações, não surpresas
Cada execução gera um relatório: o melhor modelo por categoria, os modelos a descartar, um nó mais rápido que merece o nível heavy. O Claude transforma isso numa proposta de mudança no fleet.toml para você aprovar.
Sabe quando parar
Cada par de modelo e categoria fica estável após cinco amostras consistentes. O status avisa quando é hora de uma nova execução, e nesse meio-tempo o trabalho real continua refinando as notas.
Seu código fica na sua rede
Delegar só vale a pena se não abrir novas brechas.
Por padrão, nada sai da sua máquina
Os modelos locais veem os seus arquivos; um provedor que você adicionou não vê, a menos que você defina send_files para ele. Os modelos :cloud do Ollama, que rodam no ollama.com, são ignorados se você não os autorizar explicitamente.
Acesso a arquivos restrito
O servidor lê e grava apenas dentro do projeto atual e das pastas que você indicar. Caminhos que saem dali são recusados.
Sem telemetria
Estatísticas, logs e relatórios ficam em ~/.routeai no seu computador. O plugin só se comunica com os servidores Ollama que você configurou.
Chaves e orçamentos
As chaves de API ficam em variáveis de ambiente: nunca na configuração, nunca no chat, nunca em um log, e as requisições nunca seguem redirecionamentos. Cada provedor carrega o próprio preço e um limite diário em requisições, tokens ou dólares; atingido o limite, o trabalho volta para as suas máquinas.
Gratuito e de código aberto, e vai continuar assim
O RouteAI é distribuído sob a licença MIT: use no trabalho, modifique, compartilhe. Se ele economizou tokens para você, uma pequena doação ajuda a mantê-lo.
Perguntas
Quais modelos devo usar?
A configuração sugere modelos coder adequados a cada máquina — numa GPU de 12 GB, qwen2.5-coder:14b (cerca de 50 tok/s) e o mixture-of-experts qwen3-coder:30b; num notebook só com CPU, modelos de 3–7B — e só os baixa com a sua aprovação. Para os provedores, você escolhe entre os modelos que eles oferecem. Depois, o benchmark mostra o que realmente funciona.
Quantos tokens ele economiza?
Cada tarefa concluída informa: os arquivos que o modelo leu mais o que ele escreveu, menos as instruções que o Claude escreveu e o resultado que o Claude leu. Tarefas maiores e lotes economizam milhares de tokens; as minúsculas podem custar mais do que economizam, e o relatório mostra isso, incluindo quanto um provedor pago custou a você.
O que acontece se uma máquina estiver desligada?
Ela é marcada como indisponível e o trabalho vai para as outras máquinas. Se nenhuma puder assumir uma categoria, a ferramenta avisa e o Claude simplesmente faz a tarefa ele mesmo.
Um notebook sem GPU é útil?
Sim, para scripts, testes e documentação com modelos pequenos, e como reserva quando a máquina com GPU está ocupada. Deixe uma tarefa por vez nele para que o seu próprio trabalho continue fluido.
Posso adicionar Gemini, Groq ou OpenAI?
Sim: /routeai:add-ai gemini gem1. Qualquer API compatível com OpenAI funciona, incluindo o seu próprio vLLM ou LM Studio. A chave vai em uma variável de ambiente, você decide se os seus arquivos podem ser enviados e define um limite diário em requisições, tokens ou dólares.
É um produto da Anthropic ou do Ollama?
Não. É um projeto independente de código aberto, sem afiliação com a Anthropic nem com o Ollama. Ele usa as interfaces públicas de plugins e MCP do Claude Code e a API pública do Ollama.