Claude가 이끌고, 작은 작업은 다른 AI가.
RouteAI을 사용하면 Claude가 단위 테스트, 스크립트, docstring, 빌드 파일, 일괄 편집을 이미 가지고 있는 AI에 맡길 수 있습니다. 내 컴퓨터의 Ollama 모델, 그리고 Gemini, Groq, OpenRouter 같은 제공업체의 하루 무료 사용량입니다. 무료 사용량을 먼저 쓰고, 유료는 허용할 때만 씁니다. 작업 지시를 작성하고 결과를 확인하며 최종 결정을 내리는 것은 Claude입니다.
Python 3.11과 Ollama만 있으면 됩니다 · API 제공업체는 선택 사항 · Windows, macOS, Linux · MIT 라이선스
내 하드웨어 위의 주니어 개발자 팀
의존성 없는 작은 MCP 서버, 학습하는 라우팅 엔진, 그리고 언제 위임하는 것이 좋은지 Claude에게 알려 주는 스킬.
성능과 비용에 따라 분배
모든 작업에는 카테고리가 있습니다. complex와 code는 먼저 빠른 GPU 머신으로, tests, scripts, build, docs는 느린 머신이나 제공업체의 무료 사용량으로 갑니다. 유료보다 무료를 먼저 쓰고, 우선 머신이 바쁘면 작업이 다른 곳으로 넘어갑니다.
어떤 모델을 믿을지 학습
라우터는 모델 로드 시간과 대기열까지 포함해 측정된 품질과 속도로 머신과 모델의 순위를 매깁니다. 점수는 벤치마크와, 모든 실제 결과에 대한 Claude의 평가(양호, 수정됨, 반려됨)에서 나옵니다.
거버넌스는 Claude가 유지
무엇을 위임할지 정하고, 정확한 작업 지시를 쓰고, 테스트를 실행하고 diff를 읽는 것은 Claude입니다. 설계, 보안에 민감한 코드, 여러 영역에 걸친 변경은 Claude가 직접 맡습니다. 벤치마크는 구성 변경을 제안할 뿐이며, 승인은 사용자가 합니다.
실제로 줄어드는 토큰
서버가 프로젝트 파일을 직접 읽고 결과를 디스크에 바로 쓰며, 짧은 미리 보기만 반환합니다. Claude는 파일을 붙여 넣거나 긴 답변을 다시 읽지 않으며, 모든 작업이 절약한 토큰을 보고합니다.
병렬 일괄 처리
지시 하나로 파일 40개. 모든 모듈에 테스트를, 모든 함수에 docstring을, 모든 곳에 같은 마이그레이션을. 작업은 모든 머신에 동시에 분산되고, tests/test_{stem}.py처럼 지정한 위치에 저장됩니다.
Python 외에는 설치할 것이 없습니다
순수 표준 라이브러리만 사용합니다. pip도, SDK도, Docker도 필요 없습니다. 원할 때 API 제공업체를 추가하세요. Gemini, Groq, OpenRouter, DeepSeek, Mistral, OpenAI 또는 직접 운영하는 엔드포인트를 쓸 수 있고, 키는 파일이 아니라 환경 변수에 둡니다.
구성 요소가 맞물리는 방식
Claude Code는 작은 로컬 서버 하나와만 통신하고, 그 서버가 네트워크의 Ollama 머신과, 사용자가 허용하면 추가한 API 제공업체와도 통신합니다.
- 라우터: 작업마다 노드와 모델을 선택, 유료보다 무료 먼저
- 학습된 모델별 품질과 속도
- 스스로 채점하는 벤치마크와 토큰 집계
- Claude가 작업 지시를 작성정확한 몇 줄과 파일 경로만 담습니다. 파일 내용은 절대 넣지 않으므로 Claude가 그것을 읽는 비용을 치르지 않습니다.
- 서버가 분배파일을 읽고, 카테고리에 가장 알맞은 비어 있는 머신과 모델을 고르며, 결과는 디스크에 바로 저장됩니다.
- Claude가 검증하고 평가테스트를 실행하고 diff를 읽은 뒤 결과를 양호, 수정됨, 반려됨으로 표시합니다. 라우팅은 모든 평가에서 학습합니다.
- 절약한 양을 한눈에완료된 작업마다 절약한 Claude 토큰과 세션 합계를 알려 줍니다. 아주 작은 작업은 오히려 손해일 수 있으며, 숫자가 이를 그대로 보여 줍니다.
5분이면 실행 완료
머신에서 이미 Ollama가 실행 중이라면 거의 끝났습니다.
- 플러그인 설치하기Claude Code에서 명령 두 개로 마켓플레이스를 추가하고 RouteAI을 설치합니다. MCP 서버, 위임 스킬,
/routeai:status및/routeai:bench명령이 포함됩니다. - 머신 구성하기
/routeai:setup이 각 Ollama 서버를 확인해~/.routeai/fleet.toml을 작성하고,/routeai:add-ai는 제공업체를 추가합니다. 키는 환경 변수에 그대로 남고, 내 파일을 그쪽에 보낼지는 사용자가 정합니다. - 평소처럼 작업하기계획에 테스트, 스크립트, 반복적인 코드가 있으면 Claude가 이를 위임하고, 돌아온 결과를 검증해 평가합니다. 언제든
/routeai:status로 작업이 어디로 가는지, 토큰을 얼마나 절약했는지 확인하세요.
설치
# in Claude Code /plugin marketplace add bdbais/routeai /plugin install routeai@bais # describe your machines: models are picked and suggested per machine /routeai:setup gpu=http://192.168.1.13:11434 local=http://localhost:11434 # let the fleet learn your hardware, then check routing and savings /routeai:bench /routeai:status
내 컴퓨터가 아닌 머신에서는 OLLAMA_HOST=0.0.0.0으로 Ollama를 시작해 네트워크에서 요청을 받을 수 있게 하세요. 플러그인이 Python 3.11 이상(py, python3 또는 python)을 알아서 찾습니다.
스스로 채점하는 벤치마크
Fleet이 하드웨어를 파악할 때까지 가끔 실행하세요. 학습 중에는 자주, 점수가 안정되면 한 달에 한 번이면 충분합니다. 유료 제공업체는 사용자가 요청하지 않는 한 건드리지 않습니다.
추측이 아닌 채점
자동 검사가 포함된 실제 작업 10개. 코드는 숨겨진 단위 테스트로 실행되고, 생성된 테스트는 일부러 심어 둔 버그를 잡아내야 하며, 스크립트는 실제로 실행되고, TOML은 파싱되며, docstring은 AST와 비교됩니다.
하드웨어를 최대한 활용
초당 토큰 수, 모델 로드 시간, 각 모델이 VRAM에 얼마나 들어가는지, 병렬 요청에 따라 처리량이 어떻게 늘어나는지 측정한 뒤, 가장 잘 맞는 컨텍스트 크기와 병렬 수준을 알려 줍니다.
뜻밖의 변화 대신 추천
실행할 때마다 보고서를 작성합니다. 카테고리별 최적 모델, 제외할 모델, heavy 등급에 어울리는 더 빠른 노드. Claude가 이를 fleet.toml 변경 제안으로 만들고, 승인은 사용자가 합니다.
멈출 때를 압니다
모델과 카테고리의 각 조합은 일관된 샘플이 5개 모이면 안정 상태가 됩니다. 새로 실행할 시점은 상태 화면이 알려 주고, 그 사이에도 실제 작업이 점수를 계속 다듬습니다.
코드는 내 네트워크 안에 머뭅니다
위임은 새로운 보안 구멍을 만들지 않을 때만 의미가 있습니다.
기본적으로 내 컴퓨터를 벗어나는 것은 없습니다
로컬 모델은 내 파일을 보지만, 사용자가 추가한 제공업체는 send_files를 설정하지 않는 한 보지 못합니다. ollama.com에서 실행되는 Ollama :cloud 모델은 명시적으로 허용하지 않는 한 무시됩니다.
제한된 파일 접근
서버는 현재 프로젝트와 사용자가 지정한 폴더 안에서만 읽고 씁니다. 그 범위를 벗어나는 경로는 거부됩니다.
원격 분석 없음
통계, 로그, 보고서는 내 컴퓨터의 ~/.routeai에 저장됩니다. 플러그인은 사용자가 구성한 Ollama 서버하고만 통신합니다.
키와 예산
API 키는 환경 변수에 둡니다. 구성에도, 대화에도, 로그에도 남지 않으며, 요청은 리디렉션을 따라가지 않습니다. 제공업체마다 자체 가격과 요청 수, 토큰 또는 달러 기준의 하루 한도가 있으며, 한도에 도달하면 작업은 내 머신으로 돌아옵니다.
무료 오픈 소스, 앞으로도 계속
RouteAI은 MIT 라이선스로 배포됩니다. 업무에 사용하고, 수정하고, 공유하세요. 토큰을 아껴 주었다면, 작은 후원이 프로젝트를 이어 가는 데 도움이 됩니다.
자주 묻는 질문
어떤 모델을 써야 하나요?
설정 과정에서 각 머신에 맞는 coder 모델을 추천합니다. 12 GB GPU에서는 qwen2.5-coder:14b(약 50 tok/s)와 mixture-of-experts 모델 qwen3-coder:30b, CPU만 있는 노트북에서는 3–7B 모델이며, 사용자가 승인할 때만 내려받습니다. 제공업체는 그쪽에서 제공하는 모델 중에서 고릅니다. 그다음 실제로 무엇이 잘 동작하는지는 벤치마크가 보여 줍니다.
토큰을 얼마나 절약할 수 있나요?
완료된 작업마다 알려 줍니다. 워커가 읽은 파일과 작성한 내용에서 Claude가 쓴 작업 지시와 Claude가 읽은 결과를 뺀 값입니다. 규모 있는 작업과 일괄 작업은 수천 토큰을 절약하고, 아주 작은 작업은 절약보다 비용이 더 클 수 있으며, 유료 제공업체에 든 비용까지 보고서가 그대로 알려 줍니다.
머신이 꺼져 있으면 어떻게 되나요?
해당 머신은 사용 불가로 표시되고 작업은 다른 머신으로 갑니다. 어떤 카테고리를 처리할 머신이 없으면 도구가 이를 알리고, Claude가 그 작업을 직접 수행합니다.
GPU 없는 노트북도 쓸모가 있나요?
네. 작은 모델로 스크립트, 테스트, 문서를 처리하고, GPU 머신이 바쁠 때 넘치는 작업을 받아 줍니다. 한 번에 작업 하나만 맡기면 내 작업도 계속 쾌적합니다.
Gemini, Groq, OpenAI를 추가할 수 있나요?
네: /routeai:add-ai gemini gem1. 직접 운영하는 vLLM이나 LM Studio를 포함해 OpenAI 호환 API라면 무엇이든 됩니다. 키는 환경 변수에 두고, 내 파일을 보낼지는 사용자가 정하며, 요청 수, 토큰 또는 달러 기준으로 하루 한도를 정합니다.
Anthropic이나 Ollama의 제품인가요?
아니요. Anthropic이나 Ollama와 제휴하지 않은 독립적인 오픈 소스 프로젝트입니다. Claude Code의 공개 플러그인 및 MCP 인터페이스와 Ollama의 공개 API를 사용합니다.