Claude 主导,小任务交给你的其他 AI。
有了 RouteAI,Claude 可以把单元测试、脚本、docstring、构建文件和批量修改交给你已有的 AI:你电脑上的 Ollama 模型,以及 Gemini、Groq 或 OpenRouter 等提供商的每日免费额度。先用免费的,付费的只在你允许时才用,而 Claude 编写任务说明、检查结果,并保留最终决定权。
只需 Python 3.11 和 Ollama · API 提供商可选 · Windows、macOS、Linux · MIT 许可证
在你自己的硬件上,拥有一支初级开发者团队
一个无依赖的小型 MCP 服务器、一个会学习的路由核心,以及一个告诉 Claude 何时值得委派的 skill。
按性能和成本分配
每个任务都有一个类别。complex 和 code 优先交给快速的 GPU 机器;tests、scripts、build 和 docs 交给较慢的机器,或某个提供商的免费额度。先用免费的额度,再用付费的;首选机器忙碌时,任务会转给其余机器。
学会该信任哪个模型
路由器根据实测的质量和速度(包括模型加载时间和排队情况)为机器和模型排序。分数来自基准测试,也来自 Claude 对每个真实结果的评价:良好、已修正或已退回。
管控权始终在 Claude 手中
由 Claude 决定委派什么、编写精确的任务说明、运行测试并阅读 diff。设计、涉及安全的代码和跨模块的改动仍由 Claude 负责。基准测试只会建议配置更改,是否采纳由你决定。
真正节省 token
服务器会自行读取项目文件,并将结果直接写入磁盘,只返回简短的预览。Claude 从不粘贴文件,也不回读冗长的答复,而且每个任务都会报告它节省的 token。
并行批处理
一条指令,四十个文件:为每个模块写测试,为每个函数加 docstring,在所有地方执行同一次迁移。任务会同时分布到你的所有机器上,并写入你指定的位置,例如 tests/test_{stem}.py。
只需安装 Python
纯标准库:无需 pip、SDK 或 Docker。随时可以加入一个 API 提供商——Gemini、Groq、OpenRouter、DeepSeek、Mistral、OpenAI 或你自己的端点——密钥放在环境变量里,绝不写进文件。
各部分如何协作
Claude Code 只与一个小型本地服务器通信;服务器再与你网络中的 Ollama 机器通信,如果你允许,也会与你添加的 API 提供商通信。
- 路由器:为每个任务选择节点和模型,先免费后付费
- 学习得出的每个模型的质量和速度
- 自我评分的基准测试与 token 统计
- Claude 编写任务说明几行精确的说明加上文件路径——从不包含文件内容,所以 Claude 无需为读取它们付费。
- 服务器负责分配它读取文件,为该类别挑选最合适的空闲机器和模型,结果直接写入磁盘。
- Claude 验证并评分它运行测试、阅读 diff,并将结果标记为良好、已修正或已退回。路由会从每一次评分中学习。
- 清楚看到节省了多少每个完成的任务都会报告节省的 Claude token 以及本次会话的总计。极小的任务可能得不偿失,数字也会如实显示。
五分钟即可运行
如果你的机器上已经在运行 Ollama,就差不多完成了。
- 安装插件在 Claude Code 中执行两条命令,即可添加 marketplace 并安装 RouteAI:包括 MCP 服务器、委派 skill,以及
/routeai:status和/routeai:bench命令。 - 描述你的机器
/routeai:setup会探测每台 Ollama 服务器并写入~/.routeai/fleet.toml;/routeai:add-ai用来添加提供商——密钥留在环境变量中,你的文件是否可以发给它由你决定。 - 照常工作当计划中包含测试、脚本或样板代码时,Claude 会将其委派出去,验证返回的结果并打分。随时运行
/routeai:status,查看任务去向以及节省了多少 token。
安装
# in Claude Code /plugin marketplace add bdbais/routeai /plugin install routeai@bais # describe your machines: models are picked and suggested per machine /routeai:setup gpu=http://192.168.1.13:11434 local=http://localhost:11434 # let the fleet learn your hardware, then check routing and savings /routeai:bench /routeai:status
在你自己以外的机器上,用 OLLAMA_HOST=0.0.0.0 启动 Ollama,使其在网络上监听。插件会自动找到 Python 3.11+(py、python3 或 python)。
会自我评分的基准测试
不时运行一次,直到它熟悉你的硬件:学习阶段可以频繁运行,分数稳定后每月一次即可。除非你主动要求,付费提供商不会被动用。
实测评分,而非猜测
十个真实任务,配有自动检查:代码要通过隐藏的单元测试,生成的测试必须抓出刻意植入的 bug,脚本会被实际执行,TOML 会被解析,docstring 会与 AST 比对。
充分发挥硬件性能
它会测量每秒 token 数、模型加载时间、每个模型有多少能放进 VRAM,以及吞吐量如何随并行请求增长——然后告诉你效果最佳的上下文大小和并行度。
给出建议,而非意外
每次运行都会生成一份报告:每个类别的最佳模型、应当淘汰的模型、值得升入 heavy 级别的更快节点。Claude 会把它转换为一项 fleet.toml 修改提案,由你批准。
知道何时该停
每个模型与类别的组合在获得五次一致的样本后即视为稳定。status 命令会提示何时需要再次运行,而在此期间,真实工作也会持续完善分数。
你的代码留在你的网络中
委派只有在不引入新漏洞的前提下才有意义。
默认不会有任何东西离开你的电脑
本地模型能看到你的文件;你添加的提供商则看不到,除非你为它设置 send_files。在 ollama.com 上运行的 Ollama :cloud 模型,除非你明确允许,否则会被忽略。
受限的文件访问
服务器只在当前项目及你列出的文件夹内读写。越界的路径会被拒绝。
无遥测
统计数据、日志和报告都保存在你电脑上的 ~/.routeai 中。插件只与你配置的 Ollama 服务器通信。
密钥与预算
API 密钥存放在环境变量中:绝不写进配置、绝不出现在对话里、绝不进入日志,请求也从不跟随重定向。每个提供商都带有自己的价格,以及按请求数、token 或美元计的每日上限;达到上限后,工作就回到你自己的机器上。
免费开源,并将一直如此
RouteAI 以 MIT 许可证发布:可以在工作中使用、修改和分享。如果它为你节省了 token,一笔小额捐赠可以帮助它持续发展。
常见问题
应该使用哪些模型?
setup 命令会为每台机器推荐合适的 coder 模型——在 12 GB 的 GPU 上推荐 qwen2.5-coder:14b(约 50 tok/s)和混合专家模型 qwen3-coder:30b,在只有 CPU 的笔记本上推荐 3–7B 模型——并且只在你同意后才下载。至于提供商,则从它们提供的模型中挑选。之后,基准测试会告诉你实际什么效果最好。
能节省多少 token?
每个完成的任务都会告诉你:工作模型读取的文件加上它写出的内容,减去 Claude 编写的任务说明和 Claude 读取的结果。较大的任务和批处理可节省数千 token;极小的任务可能得不偿失,报告也会如实说明,包括付费提供商花了你多少钱。
如果某台机器关机了怎么办?
它会被标记为不可用,任务会转给其他机器。如果没有机器能处理某个类别,工具会如实告知,Claude 就自己完成该任务。
没有 GPU 的笔记本有用吗?
有用:可以用小模型处理脚本、测试和文档,并在 GPU 机器繁忙时承接转移过来的任务。让它一次只处理一个任务,这样你自己的工作仍能保持流畅。
可以加入 Gemini、Groq 或 OpenAI 吗?
可以:/routeai:add-ai gemini gem1。任何兼容 OpenAI 的 API 都可以,包括你自己的 vLLM 或 LM Studio。密钥放在环境变量里,你的文件是否可以发送由你决定,还可以设置按请求数、token 或美元计的每日上限。
这是 Anthropic 或 Ollama 的产品吗?
不是。这是一个独立的开源项目,与 Anthropic 和 Ollama 均无关联。它使用 Claude Code 公开的插件和 MCP 接口,以及 Ollama 的公开 API。