컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

juxhinr/bindwidth

128JavaScriptMIT

사내에 LLM을 직접 돌릴 때 몇 대의 서버가 필요한지, 정말 자체 구축이 싼지를 계산해주는 도구

Bindwidth는 회사 내부(온프레미스)에 거대언어모델을 직접 설치해 운영할 때 필요한 장비 규모와 총소유비용(TCO)을 브라우저에서 계산해주는 오픈소스 계산기다. 메모리 용량, 처리 속도, 동시 접속 한도라는 세 가지 제약 중 실제로 병목이 되는 것을 찾아내고, 그 병목 기준으로 장비를 산정한다. 서버 전송 없이 브라우저 안에서만 동작하며 자체 구매, 국가 인증 임대, 구독형 API를 투명하게 비교해준다.

무엇을 하는 레포인가

  1. 직원처럼 일하는 사람 사용자와 24시간 도는 AI 에이전트를 서로 다른 부하 패턴으로 구분해 계산한다
  2. 모델의 파라미터 수, 활성 파라미터 수, 정밀도, 캐시 용량 등 여섯 개 아키텍처 변수를 반영해 필요한 GPU 대수를 산출한다
  3. 메모리(KV 캐시), 처리 용량(prefill/decode), 동시 세션 한도 세 가지 제약을 각각 계산해 그중 최대값이 실제 병목임을 보여준다
  4. 측정된 데이터인지 추정치인지 신뢰도 등급을 매겨 결과 보고서에 함께 표시한다
  5. 전체 계산 로직이 순수 함수로 구현된 엔진과 테스트 코드로 검증되어 있다

왜 중요한가

온프레미스 AI 도입 여부를 결정할 때 예산 문제로 착각하기 쉬운 것이 사실은 규모 산정 문제라는 점을 짚어준다. 잘못된 제약 조건을 기준으로 장비를 사면 남는 용량은 낭비되고 진짜 한계는 놓치게 되는데, 이 도구는 그 실수를 막아준다.

이 레포의 용어

  • KV 캐시 · 모델이 이전 대화 내용을 기억하기 위해 메모리에 저장해두는 임시 데이터
  • prefill/decode · 입력 문장을 처리하는 단계(prefill)와 답변을 한 토큰씩 생성하는 단계(decode)
  • TCO(총소유비용) · 장비 구매비뿐 아니라 전기료, 관리 인건비 등을 모두 합친 실제 운영 비용
  • MoE(전문가 혼합 모델) · 전체 파라미터 중 일부만 활성화해 계산하는 모델 구조로, 크기와 속도가 따로 결정된다
  • 온프레미스 · 클라우드가 아닌 회사 자체 서버에 시스템을 설치해 운영하는 방식

레포 원문 소개 (영문)

Evidence-aware on-prem LLM inference sizing and TCO calculator

GitHub에서 보기

주목받는 레포

레포 전체 보기 →

METAL MEDIA 최신 기사