Claude Code 插件 · 免费 · 开源

Claude 主导,小任务交给你的其他 AI。

有了 RouteAI,Claude 可以把单元测试、脚本、docstring、构建文件和批量修改交给你已有的 AI:你电脑上的 Ollama 模型,以及 Gemini、Groq 或 OpenRouter 等提供商的每日免费额度。先用免费的,付费的只在你允许时才用,而 Claude 编写任务说明、检查结果,并保留最终决定权。

只需 Python 3.11 和 Ollama · API 提供商可选 · Windows、macOS、Linux · MIT 许可证

在你自己的硬件上,拥有一支初级开发者团队

一个无依赖的小型 MCP 服务器、一个会学习的路由核心,以及一个告诉 Claude 何时值得委派的 skill。

按性能和成本分配

每个任务都有一个类别。complexcode 优先交给快速的 GPU 机器;testsscriptsbuilddocs 交给较慢的机器,或某个提供商的免费额度。先用免费的额度,再用付费的;首选机器忙碌时,任务会转给其余机器。

学会该信任哪个模型

路由器根据实测的质量和速度(包括模型加载时间和排队情况)为机器和模型排序。分数来自基准测试,也来自 Claude 对每个真实结果的评价:良好、已修正或已退回。

管控权始终在 Claude 手中

由 Claude 决定委派什么、编写精确的任务说明、运行测试并阅读 diff。设计、涉及安全的代码和跨模块的改动仍由 Claude 负责。基准测试只会建议配置更改,是否采纳由你决定。

真正节省 token

服务器会自行读取项目文件,并将结果直接写入磁盘,只返回简短的预览。Claude 从不粘贴文件,也不回读冗长的答复,而且每个任务都会报告它节省的 token。

并行批处理

一条指令,四十个文件:为每个模块写测试,为每个函数加 docstring,在所有地方执行同一次迁移。任务会同时分布到你的所有机器上,并写入你指定的位置,例如 tests/test_{stem}.py

只需安装 Python

纯标准库:无需 pip、SDK 或 Docker。随时可以加入一个 API 提供商——Gemini、Groq、OpenRouter、DeepSeek、Mistral、OpenAI 或你自己的端点——密钥放在环境变量里,绝不写进文件。

各部分如何协作

Claude Code 只与一个小型本地服务器通信;服务器再与你网络中的 Ollama 机器通信,如果你允许,也会与你添加的 API 提供商通信。

Claude Code决定委派什么、编写任务说明、验证结果,并保留最终决定权。
routeai由插件启动的无依赖 Python 进程。
  • 路由器:为每个任务选择节点和模型,先免费后付费
  • 学习得出的每个模型的质量和速度
  • 自我评分的基准测试与 token 统计
带 GPU 的台式机complex · code
笔记本(CPU)tests · scripts · build · docs
API 提供商可选:先用免费额度,付费需设预算
租用服务器可选,置于 VPN 之后
  1. Claude 编写任务说明几行精确的说明加上文件路径——从不包含文件内容,所以 Claude 无需为读取它们付费。
  2. 服务器负责分配它读取文件,为该类别挑选最合适的空闲机器和模型,结果直接写入磁盘。
  3. Claude 验证并评分它运行测试、阅读 diff,并将结果标记为良好、已修正或已退回。路由会从每一次评分中学习。
  4. 清楚看到节省了多少每个完成的任务都会报告节省的 Claude token 以及本次会话的总计。极小的任务可能得不偿失,数字也会如实显示。

五分钟即可运行

如果你的机器上已经在运行 Ollama,就差不多完成了。

  1. 安装插件在 Claude Code 中执行两条命令,即可添加 marketplace 并安装 RouteAI:包括 MCP 服务器、委派 skill,以及 /routeai:status/routeai:bench 命令。
  2. 描述你的机器/routeai:setup 会探测每台 Ollama 服务器并写入 ~/.routeai/fleet.toml/routeai:add-ai 用来添加提供商——密钥留在环境变量中,你的文件是否可以发给它由你决定。
  3. 照常工作当计划中包含测试、脚本或样板代码时,Claude 会将其委派出去,验证返回的结果并打分。随时运行 /routeai:status,查看任务去向以及节省了多少 token。

安装

# in Claude Code
/plugin marketplace add bdbais/routeai
/plugin install routeai@bais

# describe your machines: models are picked and suggested per machine
/routeai:setup gpu=http://192.168.1.13:11434 local=http://localhost:11434

# let the fleet learn your hardware, then check routing and savings
/routeai:bench
/routeai:status

在你自己以外的机器上,用 OLLAMA_HOST=0.0.0.0 启动 Ollama,使其在网络上监听。插件会自动找到 Python 3.11+(pypython3python)。

会自我评分的基准测试

不时运行一次,直到它熟悉你的硬件:学习阶段可以频繁运行,分数稳定后每月一次即可。除非你主动要求,付费提供商不会被动用。

实测评分,而非猜测

十个真实任务,配有自动检查:代码要通过隐藏的单元测试,生成的测试必须抓出刻意植入的 bug,脚本会被实际执行,TOML 会被解析,docstring 会与 AST 比对。

充分发挥硬件性能

它会测量每秒 token 数、模型加载时间、每个模型有多少能放进 VRAM,以及吞吐量如何随并行请求增长——然后告诉你效果最佳的上下文大小和并行度。

给出建议,而非意外

每次运行都会生成一份报告:每个类别的最佳模型、应当淘汰的模型、值得升入 heavy 级别的更快节点。Claude 会把它转换为一项 fleet.toml 修改提案,由你批准。

知道何时该停

每个模型与类别的组合在获得五次一致的样本后即视为稳定。status 命令会提示何时需要再次运行,而在此期间,真实工作也会持续完善分数。

你的代码留在你的网络中

委派只有在不引入新漏洞的前提下才有意义。

默认不会有任何东西离开你的电脑

本地模型能看到你的文件;你添加的提供商则看不到,除非你为它设置 send_files。在 ollama.com 上运行的 Ollama :cloud 模型,除非你明确允许,否则会被忽略。

受限的文件访问

服务器只在当前项目及你列出的文件夹内读写。越界的路径会被拒绝。

无遥测

统计数据、日志和报告都保存在你电脑上的 ~/.routeai 中。插件只与你配置的 Ollama 服务器通信。

密钥与预算

API 密钥存放在环境变量中:绝不写进配置、绝不出现在对话里、绝不进入日志,请求也从不跟随重定向。每个提供商都带有自己的价格,以及按请求数、token 或美元计的每日上限;达到上限后,工作就回到你自己的机器上。

免费开源,并将一直如此

RouteAI 以 MIT 许可证发布:可以在工作中使用、修改和分享。如果它为你节省了 token,一笔小额捐赠可以帮助它持续发展。

常见问题

应该使用哪些模型?

setup 命令会为每台机器推荐合适的 coder 模型——在 12 GB 的 GPU 上推荐 qwen2.5-coder:14b(约 50 tok/s)和混合专家模型 qwen3-coder:30b,在只有 CPU 的笔记本上推荐 3–7B 模型——并且只在你同意后才下载。至于提供商,则从它们提供的模型中挑选。之后,基准测试会告诉你实际什么效果最好。

能节省多少 token?

每个完成的任务都会告诉你:工作模型读取的文件加上它写出的内容,减去 Claude 编写的任务说明和 Claude 读取的结果。较大的任务和批处理可节省数千 token;极小的任务可能得不偿失,报告也会如实说明,包括付费提供商花了你多少钱。

如果某台机器关机了怎么办?

它会被标记为不可用,任务会转给其他机器。如果没有机器能处理某个类别,工具会如实告知,Claude 就自己完成该任务。

没有 GPU 的笔记本有用吗?

有用:可以用小模型处理脚本、测试和文档,并在 GPU 机器繁忙时承接转移过来的任务。让它一次只处理一个任务,这样你自己的工作仍能保持流畅。

可以加入 Gemini、Groq 或 OpenAI 吗?

可以:/routeai:add-ai gemini gem1。任何兼容 OpenAI 的 API 都可以,包括你自己的 vLLM 或 LM Studio。密钥放在环境变量里,你的文件是否可以发送由你决定,还可以设置按请求数、token 或美元计的每日上限。

这是 Anthropic 或 Ollama 的产品吗?

不是。这是一个独立的开源项目,与 Anthropic 和 Ollama 均无关联。它使用 Claude Code 公开的插件和 MCP 接口,以及 Ollama 的公开 API。