컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

antonygiomarxdev/synapse

11RustApache-2.0

거대한 MoE AI 모델을 여러 대의 저가형 그래픽카드에 나눠 돌리는 오픈소스 인프라가 나왔다

Synapse는 Mixture-of-Experts(MoE) 방식 AI 모델의 '전문가(expert)' 부분들을 값비싼 데이터센터급 GPU 한 대가 아니라 여러 대의 일반 소비자용 GPU에 나눠서 실행하는 Rust 기반 인프라다. 개발자는 이렇게 나눠서 계산해도 한 대에서 돌린 것과 완전히 동일한 결과가 나온다는 것을 증명했고, 워커(작업 노드)를 늘리면 처리 속도도 소폭 빨라졌다고 밝혔다. 연구자나 데이터센터급 장비 예산이 없는 소규모 팀을 대상으로 한 프로젝트다.

무엇을 하는 레포인가

  1. MoE 모델은 입력 하나(토큰)당 전체 파라미터 중 극히 일부(약 2%로 언급)만 사용하는데, Synapse는 이 활성화되는 '전문가' 부분들을 하나의 큰 GPU가 아니라 여러 대의 워커 머신에 나눠 배치한다.
  2. 시스템은 작업을 받는 게이트웨이, 작업을 배분하는 스케줄러, GGUF 모델 파일에서 자신이 맡은 전문가만 불러오는 워커 노드로 구성되며, 실시간 채팅용 '스펙큘레이티브 네트워크'와 배치 처리용 '네트워크 DAG' 두 가지 모드를 제공한다.
  3. 테스트 모델(granite3.1-moe:3b) 기준, 워커 2대로 나눠 실행하면 단일 실행 대비 1.35배, 4대로 나누면 1.43배 빨라졌고, 그러면서도 결과값은 수학적으로 완전히 동일했다(코사인 유사도 1.000000).
  4. 자체 MoE 연산 결과가 기존 검증된 구현체(llama.cpp/llama-cpp-python)와 0.999의 상관관계로 거의 일치함을 보였고, 워커 하나가 다운돼도 재시도를 통해 작업이 끝까지 완료됨을 확인했다.
  5. README는 이를 'V0' 단계로 표기하며, 핵심 아이디어는 작은 모델로 검증된 상태이고 더 큰 모델(Mixtral, DeepSeek 등)을 여러 물리 머신에 나눌수록 속도 향상이 커질 것으로 기대한다고 밝혔다.

왜 중요한가

현재 대형 MoE 언어모델을 돌리려면 보통 값비싼 데이터센터급 GPU 여러 대가 필요한데, 이 프로젝트의 방식이 성립한다면 개인이나 소규모 팀도 이미 가진 게이밍용 GPU 한 대로 큰 모델을 돌릴 길이 열릴 수 있다. MoE 구조의 특성(토큰마다 일부만 사용)을 확장의 부담이 아니라 분산의 기회로 재해석했다는 점에서 AI 인프라·도구 생태계에 의미가 있다.

이 레포의 용어

  • Mixture-of-Experts(MoE) · 입력마다 모델 전체가 아니라 일부 '전문가' 하위 네트워크만 사용하는 AI 모델 설계 방식
  • GGUF · AI 모델의 가중치(파라미터)를 효율적으로 저장·불러오기 위한 파일 형식
  • 코사인 유사도 · 두 결과가 얼마나 비슷한지를 -1~1 사이 숫자로 나타낸 값, 1.0이면 완전히 동일함을 뜻함
  • FFN(피드포워드 네트워크) · AI 모델 내부에서 데이터를 처리하는 기본 연산 블록으로, 여기서는 나눠서 분산시키는 '전문가' 부분에 해당
  • axum · 웹 서버를 만들 때 쓰는 Rust 언어용 라이브러리, Synapse의 게이트웨이 구현에 사용됨

레포 원문 소개 (영문)

Distributed inference infrastructure for Mixture-of-Experts models. Run large MoE models on consumer GPUs.

GitHub에서 보기

주목받는 레포

레포 전체 보기 →

METAL MEDIA 최신 기사