컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

cactus-compute/needle

7,907이번 주 +3,838Python

14메가바이트짜리 AI 모델로 스마트폰과 웨어러블에서 인터넷 없이 도구 호출하기

Needle 2는 Cactus Compute가 만든 4500만 개 파라미터 모델로, 도구 호출과 텍스트에서 구조화된 데이터를 뽑아내는 데 특화되어 있다. 전체 모델이 단 14MB 바이너리 하나에 담겨 있고 실행 시 램 사용량은 약 28MB에 불과하다. 2비트로 압축된 자체 추론 엔진과 함께 배포되어 인터넷 연결 없이도 작은 기기에서 완전히 동작한다.

무엇을 하는 레포인가

  1. 무엇을: 도구 호출, 기기 내 실행, 구조화된 추출(텍스트를 JSON으로 변환)에 특화된 오픈소스 소형 언어모델로, 스마트폰·웨어러블·스마트홈 기기·로봇을 겨냥한다.
  2. 어떻게: 팀이 자체 고안한 'Simple Attention Network'라는 설계(관련 논문에 서술됨)를 기반으로, Cactus Quants라는 자체 양자화 기법으로 2비트까지 압축해 인터넷 연결이 필요 없는 독립형 엔진에 담았다.
  3. 결과: 논문에 실린 벤치마크에서 Needle 2는 FunctionGemma 270M, LFM2.5 230M, Apple FM 같은 다른 소형 모델들과 승부를 주고받으면서도, 크기는 5배에서 70배 더 작고 정밀도는 이들의 16비트(f16) 대비 2비트에 불과하다.
  4. 추가 기능: 응답마다 신뢰도 점수가 함께 나와 이 값이 낮으면 사람에게 넘길 수 있고, 대규모 도구 목록 중 매 턴마다 관련성 높은 상위 5개만 골라내는 검색 기능이 있으며, 256토큰 슬라이딩 윈도우 방식으로 대화가 아무리 길어져도 메모리 사용량이 일정하게 유지된다.
  5. 사용 흐름: pip로 설치한 뒤 파이썬 함수에 데코레이터를 붙여 도구로 등록하고 agent.run()을 호출하면 되며, LoRA(고정된 기반 모델에 가벼운 추가 학습만 하는 방식)로 자체 데이터를 이용해 미세조정한 뒤 새로운 경량 파일로 내보낼 수도 있다.

왜 중요한가

클라우드가 아닌 기기 안에서 AI를 돌리면 인터넷 없이도 작동하고, 개인정보가 외부로 나가지 않으며, 서버 비용도 들지 않는다. 이는 인터넷 연결이 늘 보장되지 않는 웨어러블, 스마트홈 기기, 로봇 같은 제한된 하드웨어에서도 구조화된 출력을 다루는 쓸 만한 모델을 얼마나 작게 만들 수 있는지 보여주는 실제 사례다.

이 레포의 용어

  • LoRA · 기반 모델 전체를 다시 학습시키는 대신 작은 추가 부품만 학습시키는 가벼운 미세조정 방식
  • 양자화 / 2비트(CQ2) · 모델의 숫자값을 표현하는 비트 수를 크게 줄여 파일 크기를 줄이는 대신 정밀도를 일부 희생하는 압축 기법
  • 문법 제약 디코딩 · 모델이 토큰을 하나씩 생성할 때마다 정해진 JSON 구조를 벗어나지 못하게 강제하는 방식
  • KV 싱크 / 슬라이딩 윈도우 · 대화 기록 전체를 무한정 쌓지 않고 정해진 크기만 메모리에 유지하는 기법
  • GQA(그룹 쿼리 어텐션) · 트랜스포머 모델에서 메모리 사용량을 줄여주는 효율적인 어텐션 방식

레포 원문 소개 (영문)

14MB foundation model for tiny devices; phones, wearables, smart home, and robots.

GitHub에서 보기

주목받는 레포

레포 전체 보기 →

METAL MEDIA 최신 기사