컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

google-ai-edge/ai-edge-quantizer

188PythonApache-2.0

구글이 학습 끝난 AI 모델을 재훈련 없이 압축해 휴대폰·엣지 기기에 넣는 도구를 공개했다

AI Edge Quantizer(AEQ)는 이미 학습이 끝난 LiteRT(옛 TensorFlow Lite) 모델을 더 작고 빠르게 만드는 후처리 압축 도구다. 레이어마다 다른 정밀도를 섞어 쓰거나 특정 레이어만 골라 압축할 수 있고, 압축 후 정확도 손실을 바로 측정하는 기능도 들어 있다. 명령줄 도구와 파이썬 API 둘 다 제공된다.

무엇을 하는 레포인가

  1. 비전 모델, LLM, 생성형 AI 파이프라인을 INT8·INT4 같은 저비트 정수 형태로 압축해 휴대폰 CPU·GPU·NPU에 배포할 수 있게 함
  2. 이름 패턴(정규식)으로 특정 레이어만 골라 압축하는 선택적 양자화와, 레이어별로 다른 정밀도(예: 일부는 INT4, 일부는 INT8)를 섞는 혼합 정밀도 양자화 지원
  3. 블록 단위 양자화, 이상치를 줄여 초저비트(INT4·INT2)에서도 정확도를 지키는 Hadamard 변환, GPTQ·OCTAV 같은 최적화 알고리즘 포함
  4. 보정 데이터가 필요 없는 동적 양자화, 속도 이득은 없지만 품질이 가장 좋은 가중치 전용 양자화, 보정 데이터로 가중치와 활성값을 모두 정수화하는 정적 양자화 세 가지 방식 제공
  5. 명령줄 도구 aeq와 파이썬 API를 함께 제공하며, MSE·SNR·코사인 유사도·KL 발산 등으로 압축 전후 오차를 직접 측정하고 Model Explorer로 시각화하는 기능 내장

왜 중요한가

후처리 양자화는 재훈련 비용 없이 대형 모델을 휴대폰 같은 자원 제한 기기에서 돌릴 수 있게 하는 핵심 방법 중 하나다. 레이어별 선택 압축과 내장 검증 기능은 최신 LLM을 포함한 실제 배포에서 속도와 정확도의 균형을 잡기 쉽게 해준다.

이 레포의 용어

  • 후처리 양자화(PTQ) · 모델을 다 학습시킨 뒤 재훈련 없이 숫자를 저비트로 바꿔 압축하는 기법
  • LiteRT · 구글의 모바일·엣지 기기용 AI 실행 런타임, 옛 이름은 TensorFlow Lite
  • NPU · AI 연산에 특화된 전용 반도체 칩
  • 정적 양자화·보정(calibration) · 실제 샘플 데이터를 모델에 흘려보내 얻은 통계로 가중치와 활성값을 모두 정수화하는 방식
  • GPTQ·OCTAV · 양자화로 인한 정확도 손실을 줄이기 위한 최적화 알고리즘

레포 원문 소개 (영문)

AI Edge Quantizer: flexible post training quantization for LiteRT models.

소속 · google-deepmind

GitHub에서 보기

주목받는 레포

레포 전체 보기 →

METAL MEDIA 최신 기사