컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

NVIDIA-NeMo/Switchyard

1,927이번 주 +1,220Rust

코딩 에이전트는 그대로 두고, 뒤에서 모델만 자유롭게 바꿔치기하는 라우터

Switchyard는 Claude Code나 Codex 같은 코딩 에이전트가 쓰는 API 형식을 그대로 유지하면서, 실제 요청은 vLLM·NVIDIA NIM·Ollama 등 다른 모델로 보내주는 Rust 기반 프록시다. OpenAI와 Anthropic API 형식을 서로 변환해주기 때문에 에이전트 쪽 코드를 건드리지 않고도 백엔드 모델을 바꾸거나 여러 모델에 트래픽을 나눠 실험할 수 있다. 아직 프로덕션용이 아닌 pre-alpha 단계 소프트웨어다.

무엇을 하는 레포인가

  1. 에이전트나 앱은 OpenAI Chat, Anthropic Messages, OpenAI Responses 중 원래 쓰던 API 형식을 그대로 사용하고, Switchyard가 뒤에서 실제 백엔드 모델의 형식으로 번역해 요청을 전달한다.
  2. 무작위 분배, LLM을 이용한 요청 분류 후 라우팅, 대화 속 신호(도구 결과, 에러 등)를 보고 라우팅하는 스테이지 라우터, 약한 모델로 먼저 처리 후 판별기가 강한 모델로 올릴지 정하는 에스컬레이션 라우터 등 여러 라우팅 전략을 지원한다.
  3. 독립 실행형 서버(switchyard-server), 명령줄 런처(switchyard CLI), 또는 자체 앱에 라우팅 로직만 끼워 넣는 라이브러리(switchyard-libsy) 세 가지 방식으로 사용할 수 있다.
  4. 요청 수, 에러, 지연시간, 토큰 수, 라우팅 오버헤드 등을 Prometheus 지표로 수집해 운영 상태를 모니터링할 수 있다.
  5. GitHub 스타 1927개를 받은 Rust 프로젝트이며, Apache 2.0 라이선스로 NVIDIA가 저작권을 갖고 있다.

왜 중요한가

오픈소스 모델로 비용을 낮추거나 성능을 비교하고 싶은 팀이 코딩 에이전트나 애플리케이션 코드를 전혀 바꾸지 않고도 백엔드 모델을 자유롭게 바꾸거나 A/B 테스트할 수 있게 해준다. 다만 저자들 스스로 API와 알고리즘이 크게 바뀔 수 있는 실험 단계라고 밝히고 있어 실제 서비스에 바로 쓰기에는 아직 이르다.

이 레포의 용어

  • 프록시(proxy) · 클라이언트와 실제 서버 사이에서 요청을 중계해주는 중간 서버
  • OpenAI Chat / Anthropic Messages / OpenAI Responses · 각 회사가 정의한 LLM 요청-응답 형식(API 스펙)
  • vLLM, NVIDIA NIM, Ollama · 오픈소스 또는 사내에서 LLM을 직접 구동할 때 쓰는 서빙 엔진들
  • Prometheus 지표 · 서버 상태(요청 수, 지연시간 등)를 수집해 모니터링 도구로 볼 수 있게 만든 표준 형식의 측정값
  • pre-alpha · 정식 출시 이전, 기능과 API가 계속 크게 바뀔 수 있는 초기 개발 단계

레포 원문 소개 (영문)

Switchyard lets LLM applications route traffic across models and providers while preserving native OpenAI and Anthropic API compatibility - enabling flexible model selection, benchmarking, and cost/performance optimization.

GitHub에서 보기

주목받는 레포

레포 전체 보기 →

METAL MEDIA 최신 기사