google-ai-edge/ai-edge-quantizer
구글이 학습 끝난 AI 모델을 재훈련 없이 압축해 휴대폰·엣지 기기에 넣는 도구를 공개했다
AI Edge Quantizer(AEQ)는 이미 학습이 끝난 LiteRT(옛 TensorFlow Lite) 모델을 더 작고 빠르게 만드는 후처리 압축 도구다. 레이어마다 다른 정밀도를 섞어 쓰거나 특정 레이어만 골라 압축할 수 있고, 압축 후 정확도 손실을 바로 측정하는 기능도 들어 있다. 명령줄 도구와 파이썬 API 둘 다 제공된다.
무엇을 하는 레포인가
- 비전 모델, LLM, 생성형 AI 파이프라인을 INT8·INT4 같은 저비트 정수 형태로 압축해 휴대폰 CPU·GPU·NPU에 배포할 수 있게 함
- 이름 패턴(정규식)으로 특정 레이어만 골라 압축하는 선택적 양자화와, 레이어별로 다른 정밀도(예: 일부는 INT4, 일부는 INT8)를 섞는 혼합 정밀도 양자화 지원
- 블록 단위 양자화, 이상치를 줄여 초저비트(INT4·INT2)에서도 정확도를 지키는 Hadamard 변환, GPTQ·OCTAV 같은 최적화 알고리즘 포함
- 보정 데이터가 필요 없는 동적 양자화, 속도 이득은 없지만 품질이 가장 좋은 가중치 전용 양자화, 보정 데이터로 가중치와 활성값을 모두 정수화하는 정적 양자화 세 가지 방식 제공
- 명령줄 도구 aeq와 파이썬 API를 함께 제공하며, MSE·SNR·코사인 유사도·KL 발산 등으로 압축 전후 오차를 직접 측정하고 Model Explorer로 시각화하는 기능 내장
왜 중요한가
후처리 양자화는 재훈련 비용 없이 대형 모델을 휴대폰 같은 자원 제한 기기에서 돌릴 수 있게 하는 핵심 방법 중 하나다. 레이어별 선택 압축과 내장 검증 기능은 최신 LLM을 포함한 실제 배포에서 속도와 정확도의 균형을 잡기 쉽게 해준다.
이 레포의 용어
- 후처리 양자화(PTQ) · 모델을 다 학습시킨 뒤 재훈련 없이 숫자를 저비트로 바꿔 압축하는 기법
- LiteRT · 구글의 모바일·엣지 기기용 AI 실행 런타임, 옛 이름은 TensorFlow Lite
- NPU · AI 연산에 특화된 전용 반도체 칩
- 정적 양자화·보정(calibration) · 실제 샘플 데이터를 모델에 흘려보내 얻은 통계로 가중치와 활성값을 모두 정수화하는 방식
- GPTQ·OCTAV · 양자화로 인한 정확도 손실을 줄이기 위한 최적화 알고리즘
레포 원문 소개 (영문)
AI Edge Quantizer: flexible post training quantization for LiteRT models.
GitHub에서 보기주목받는 레포
- vorssaint/vorssaint-utils메뉴바 아이콘 하나로 유료 맥 앱 열 개 값을 대신하는 오픈소스 도구
- Alishahryar1/free-claude-code코딩 AI 에이전트를 무료 모델 49곳에 자유롭게 연결해주는 로컬 프록시
- freestylefly/awesome-gpt-image-2GPT-Image2로 원하는 이미지를 정확히 뽑아내는 프롬프트 설계도 532개를 모아놓은 저장소
- block/buzz사람과 AI 에이전트가 같은 채팅방에서 함께 일하는 오픈소스 협업 플랫폼
- NousResearch/hermes-agentNous Research가 만든, 쓰면 쓸수록 스스로 똑똑해지는 AI 에이전트 Hermes
- virgiliojr94/book-to-skill기술서 PDF를 AI 에이전트가 언제든 펼쳐볼 수 있는 '스킬'로 바꿔주는 도구
- VoltAgent/awesome-agent-skillsAI 코딩 도구가 특정 작업을 '전문가처럼' 하도록 도와주는 매뉴얼 1000개 이상을 한곳에 모았다
- anthropics/claude-plugins-community누구나 만든 Claude 확장 기능을 한곳에 모아 설치하게 해주는 저장소