컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

hcai-lab-gt/capabilibara

2JavaScriptAGPL-3.0

AI가 사회적 추론 능력을 어디서 배웠는지 학습 데이터를 역추적해서 찾아내다

언어모델이 특정 능력(예: 사회적 추론)을 어느 학습 문서 뭉치에서 배웠는지 찾아내는 파이프라인이다. 570만 개 문서를 576개 주제-형식 영역으로 나눠 영향력을 계산하고, 그 영역을 실제로 지워서(언러닝) 성능이 떨어지는지 검증했다. Georgia Tech, EleutherAI 등이 참여했고 COLM 2026 학회 논문으로 공개됐다.

무엇을 하는 레포인가

  1. Dolma3 학습 코퍼스에서 중복을 제거한 약 12.6억 개 문서 중 570만 개를 표본으로 뽑아 24종 주제 x 24종 형식, 총 576개 영역으로 분류했다
  2. OLMo3-7B 모델에 대해 벤치마크 질문(SocialIQA, MMLU 등)이 어떤 학습 문서의 영향을 받았는지 그래디언트 기반 기법(TrackStar)으로 계산하고, 이를 576개 영역 단위로 합산했다
  3. 영향력이 높다고 지목된 영역의 문서를 실제로 모델에서 지우는 선택적 언러닝을 수행해, 해당 영역이 진짜로 그 능력을 뒷받침하는지 인과적으로 검증했다
  4. SocialIQA 벤치마크에서 지목된 영역을 지웠을 때 성능이 1.60퍼센트포인트 떨어지는 것을 확인했다(통계적으로 유의미, p 약 10의 마이너스 5제곱)
  5. 코드와 상세 산출물(샘플링 명세, 영향력 행렬, 언러닝 체크포인트)은 논문 최종본과 함께 공개될 예정이며 현재는 저장소 구조와 방법론만 공개된 상태다

왜 중요한가

AI 모델이 왜 특정 방식으로 답하는지, 어떤 학습 데이터가 그 능력을 만들었는지 알면 모델을 더 안전하게 고치거나 문제 있는 데이터를 제거할 때 정밀하게 접근할 수 있다. 이 저장소는 그런 추적을 문서 하나하나가 아니라 데이터의 큰 영역 단위로 하고 실제 삭제 실험으로 검증하는 방법을 실제 대형 모델(OLMo3-7B)에 적용해 보여준다는 점에서 해석 가능성과 데이터 거버넌스 연구자들에게 참고가 될 수 있다.

이 레포의 용어

  • training-data attribution (학습 데이터 귀속) · 모델의 특정 답변이나 능력이 학습 데이터의 어느 부분에서 왔는지 추적하는 기법
  • machine unlearning (머신 언러닝) · 이미 학습된 모델에서 특정 데이터의 영향을 선택적으로 지우는 기법
  • WebOrganizer 24×24 taxonomy · 웹 문서를 24가지 주제와 24가지 형식으로 나누는 분류 체계
  • TrackStar (Bergson) · 그래디언트를 이용해 어떤 학습 문서가 모델 출력에 영향을 줬는지 계산하는 도구
  • LoRA · 모델 전체를 다시 학습시키지 않고 일부 작은 파라미터만 조정하는 경량 학습 기법

레포 원문 소개 (영문)

Training-data attribution as a discovery method for capability provenance in language models. COLM 2026.

GitHub에서 보기프로젝트 사이트

관련 기사

주목받는 레포

레포 전체 보기 →

METAL MEDIA 최신 기사