Plugin para Claude Code · Gratis · Código abierto

Claude dirige. Tus otras IA hacen los trabajos pequeños.

Con RouteAI, Claude pasa pruebas unitarias, scripts, docstrings, archivos de build y ediciones masivas a las IA que ya tienes: los modelos de Ollama de tus ordenadores y las cuotas gratuitas diarias de proveedores como Gemini, Groq u OpenRouter. Primero lo gratuito, de pago solo si tú lo permites, y Claude escribe las instrucciones, revisa el resultado y tiene la última palabra.

Solo Python 3.11 y Ollama · proveedores API opcionales · Windows, macOS, Linux · licencia MIT

Un equipo de desarrolladores junior en tu propio hardware

Un pequeño servidor MCP sin dependencias, un sistema de reparto que aprende y una skill que le dice a Claude cuándo vale la pena delegar.

Repartido por potencia y por coste

Cada tarea tiene una categoría. complex y code van primero a la máquina rápida con GPU; tests, scripts, build y docs, a las más lentas o a la cuota gratuita de un proveedor. Primero se usa lo gratuito y, cuando las máquinas preferidas están ocupadas, el trabajo pasa a las demás.

Aprende de qué modelo fiarse

El router clasifica máquinas y modelos según la calidad y la velocidad medidas, incluidos el tiempo de carga del modelo y la cola. Las puntuaciones salen del benchmark y de la valoración que Claude hace de cada resultado real: bueno, corregido o rechazado.

Claude mantiene la gobernanza

Claude decide qué delegar, escribe instrucciones precisas, ejecuta las pruebas y lee el diff. El diseño, el código sensible para la seguridad y los cambios transversales se quedan en manos de Claude. El benchmark solo sugiere cambios de configuración; tú los apruebas.

Menos tokens, de verdad

El servidor lee por sí mismo los archivos del proyecto y escribe los resultados directamente en disco, devolviendo solo una breve vista previa. Claude nunca pega un archivo ni vuelve a leer una respuesta larga, y cada tarea indica los tokens que ha ahorrado.

Lotes en paralelo

Una instrucción, cuarenta archivos: pruebas para cada módulo, un docstring en cada función, la misma migración en todas partes. Las tareas se reparten a la vez entre todas tus máquinas y acaban donde tú digas, p. ej. tests/test_{stem}.py.

Solo hace falta Python

Solo biblioteca estándar: sin pip, sin SDK, sin Docker. Añade un proveedor API cuando quieras — Gemini, Groq, OpenRouter, DeepSeek, Mistral, OpenAI o tu propio endpoint — con la clave en una variable de entorno, nunca en un archivo.

Cómo encajan las piezas

Claude Code habla con un pequeño servidor local; el servidor habla con las máquinas Ollama de tu red y, si lo permites, con los proveedores API que hayas añadido.

Claude CodeDecide qué delegar, escribe las instrucciones, verifica el resultado y tiene la última palabra.
routeaiUn proceso Python sin dependencias que arranca el plugin.
  • Router: elige el nodo y el modelo para cada tarea, antes lo gratuito
  • Calidad y velocidad aprendidas de cada modelo
  • Benchmark que se evalúa solo y recuento de tokens
Sobremesa con GPUcomplex · code
Portátil (CPU)tests · scripts · build · docs
Proveedores APIopcionales: primero las cuotas gratuitas, de pago solo con un límite
Servidor alquiladoopcional, detrás de una VPN
  1. Claude escribe las instruccionesUnas pocas líneas precisas y las rutas de los archivos — nunca su contenido, así Claude no paga por leerlos.
  2. El servidor lo reparteLee los archivos, elige la mejor máquina libre y el mejor modelo para la categoría, y el resultado se escribe directamente en disco.
  3. Claude verifica y valoraEjecuta las pruebas, lee el diff y marca el resultado como bueno, corregido o rechazado. El reparto aprende de cada valoración.
  4. Ves cuánto has ahorradoCada tarea terminada indica los tokens de Claude que ha ahorrado y el total de la sesión. Las tareas diminutas pueden salir en negativo, y los números lo dicen.

Funcionando en cinco minutos

Si Ollama ya se ejecuta en tus máquinas, casi has terminado.

  1. Instala el pluginDos comandos en Claude Code añaden el marketplace e instalan RouteAI: el servidor MCP, la skill de delegación y los comandos /routeai:status y /routeai:bench.
  2. Describe tus máquinas/routeai:setup sondea cada servidor Ollama y escribe ~/.routeai/fleet.toml; /routeai:add-ai añade un proveedor: su clave se queda en una variable de entorno y tú decides si tus archivos pueden llegar hasta él.
  3. Trabaja como siempreCuando un plan incluye pruebas, scripts o código repetitivo, Claude los delega, verifica lo que vuelve y lo valora. Consulta /routeai:status cuando quieras para ver adónde va el trabajo y cuántos tokens te has ahorrado.

Instalación

# in Claude Code
/plugin marketplace add bdbais/routeai
/plugin install routeai@bais

# describe your machines: models are picked and suggested per machine
/routeai:setup gpu=http://192.168.1.13:11434 local=http://localhost:11434

# let the fleet learn your hardware, then check routing and savings
/routeai:bench
/routeai:status

En las máquinas que no sean la tuya, inicia Ollama con OLLAMA_HOST=0.0.0.0 para que escuche en tu red. El plugin encuentra Python 3.11+ por sí solo (py, python3 o python).

Un benchmark que se evalúa solo

Ejecútalo de vez en cuando hasta que la flota conozca tu hardware: a menudo mientras aún está aprendiendo, una vez al mes cuando las puntuaciones sean estables. Los proveedores de pago se quedan fuera salvo que tú los pidas.

Evaluado, no adivinado

Diez tareas reales con comprobaciones automáticas: el código se ejecuta contra pruebas unitarias ocultas, las pruebas generadas deben detectar bugs introducidos a propósito, los scripts se ejecutan, el TOML se analiza y los docstrings se comparan con el AST.

Exprime tu hardware

Mide los tokens por segundo, el tiempo de carga del modelo, cuánto de cada modelo cabe en la VRAM y cómo crece el rendimiento con peticiones en paralelo, y después te indica el tamaño de contexto y el paralelismo que mejor funcionan.

Recomendaciones, no sorpresas

Cada ejecución genera un informe: el mejor modelo por categoría, los modelos que conviene quitar, un nodo más rápido que merece el nivel heavy. Claude lo convierte en una propuesta de cambio de fleet.toml para que tú la apruebes.

Sabe cuándo parar

Cada par modelo-categoría se vuelve estable tras cinco muestras coherentes. El estado te indica cuándo toca una nueva ejecución y, entretanto, el trabajo real sigue afinando las puntuaciones.

Tu código se queda en tu red

Delegar solo tiene sentido si no abre nuevos agujeros.

Por defecto no sale nada de tu máquina

Los modelos locales ven tus archivos; un proveedor que hayas añadido no, salvo que actives send_files para él. Los modelos :cloud de Ollama, que se ejecutan en ollama.com, se ignoran salvo que los permitas explícitamente.

Acceso a archivos restringido

El servidor solo lee y escribe dentro del proyecto actual y de las carpetas que indiques. Las rutas que salen de ahí se rechazan.

Sin telemetría

Estadísticas, logs e informes se quedan en ~/.routeai en tu ordenador. El plugin solo habla con los servidores Ollama que has configurado.

Claves y presupuestos

Las claves API viven en variables de entorno: nunca en la configuración, nunca en el chat, nunca en un log, y las peticiones no siguen nunca redirecciones. Cada proveedor lleva su precio y un límite diario en peticiones, tokens o dólares; al alcanzarlo, el trabajo vuelve a tus propias máquinas.

Gratuito y de código abierto, y seguirá así

RouteAI se publica con licencia MIT: úsalo en el trabajo, modifícalo, compártelo. Si te ha ahorrado tokens, una pequeña donación ayuda a mantenerlo.

Preguntas

¿Qué modelos debería usar?

La configuración inicial sugiere modelos coder adecuados para cada máquina — en una GPU de 12 GB, qwen2.5-coder:14b (unos 50 tok/s) y el mixture-of-experts qwen3-coder:30b; en un portátil solo con CPU, modelos de 3–7B — y solo los descarga con tu aprobación. Para los proveedores eliges entre los modelos que ofrecen. Después, el benchmark muestra qué funciona de verdad.

¿Cuántos tokens ahorra?

Te lo dice cada tarea terminada: los archivos que leyó el modelo más lo que escribió, menos las instrucciones que escribió Claude y el resultado que Claude leyó. Las tareas de cierto tamaño y los lotes ahorran miles de tokens; las diminutas pueden costar más de lo que ahorran, y el informe lo dice, incluido lo que te ha costado un proveedor de pago.

¿Qué pasa si una máquina está apagada?

Se marca como no disponible y el trabajo va a las demás máquinas. Si ninguna puede asumir una categoría, la herramienta lo indica y Claude simplemente se encarga de la tarea.

¿Sirve de algo un portátil sin GPU?

Sí, para scripts, pruebas y documentación con modelos pequeños, y como reserva cuando la máquina con GPU está ocupada. Déjalo en una tarea a la vez para que tu propio trabajo siga siendo fluido.

¿Puedo añadir Gemini, Groq u OpenAI?

Sí: /routeai:add-ai gemini gem1. Vale cualquier API compatible con OpenAI, incluidos tu propio vLLM o LM Studio. La clave va en una variable de entorno, tú decides si se pueden enviar tus archivos y fijas un límite diario en peticiones, tokens o dólares.

¿Es un producto de Anthropic o de Ollama?

No. Es un proyecto independiente de código abierto, sin afiliación con Anthropic ni con Ollama. Usa las interfaces públicas de plugins y MCP de Claude Code y la API pública de Ollama.