hcai-lab-gt/capabilibara
AI가 사회적 추론 능력을 어디서 배웠는지 학습 데이터를 역추적해서 찾아내다
언어모델이 특정 능력(예: 사회적 추론)을 어느 학습 문서 뭉치에서 배웠는지 찾아내는 파이프라인이다. 570만 개 문서를 576개 주제-형식 영역으로 나눠 영향력을 계산하고, 그 영역을 실제로 지워서(언러닝) 성능이 떨어지는지 검증했다. Georgia Tech, EleutherAI 등이 참여했고 COLM 2026 학회 논문으로 공개됐다.
- ai-research
- capability-provenance
- interpretability
- language-models
- machine-unlearning
- mechanistic-interpretability
- research
- training-data-attribution
무엇을 하는 레포인가
- Dolma3 학습 코퍼스에서 중복을 제거한 약 12.6억 개 문서 중 570만 개를 표본으로 뽑아 24종 주제 x 24종 형식, 총 576개 영역으로 분류했다
- OLMo3-7B 모델에 대해 벤치마크 질문(SocialIQA, MMLU 등)이 어떤 학습 문서의 영향을 받았는지 그래디언트 기반 기법(TrackStar)으로 계산하고, 이를 576개 영역 단위로 합산했다
- 영향력이 높다고 지목된 영역의 문서를 실제로 모델에서 지우는 선택적 언러닝을 수행해, 해당 영역이 진짜로 그 능력을 뒷받침하는지 인과적으로 검증했다
- SocialIQA 벤치마크에서 지목된 영역을 지웠을 때 성능이 1.60퍼센트포인트 떨어지는 것을 확인했다(통계적으로 유의미, p 약 10의 마이너스 5제곱)
- 코드와 상세 산출물(샘플링 명세, 영향력 행렬, 언러닝 체크포인트)은 논문 최종본과 함께 공개될 예정이며 현재는 저장소 구조와 방법론만 공개된 상태다
왜 중요한가
AI 모델이 왜 특정 방식으로 답하는지, 어떤 학습 데이터가 그 능력을 만들었는지 알면 모델을 더 안전하게 고치거나 문제 있는 데이터를 제거할 때 정밀하게 접근할 수 있다. 이 저장소는 그런 추적을 문서 하나하나가 아니라 데이터의 큰 영역 단위로 하고 실제 삭제 실험으로 검증하는 방법을 실제 대형 모델(OLMo3-7B)에 적용해 보여준다는 점에서 해석 가능성과 데이터 거버넌스 연구자들에게 참고가 될 수 있다.
이 레포의 용어
- training-data attribution (학습 데이터 귀속) · 모델의 특정 답변이나 능력이 학습 데이터의 어느 부분에서 왔는지 추적하는 기법
- machine unlearning (머신 언러닝) · 이미 학습된 모델에서 특정 데이터의 영향을 선택적으로 지우는 기법
- WebOrganizer 24×24 taxonomy · 웹 문서를 24가지 주제와 24가지 형식으로 나누는 분류 체계
- TrackStar (Bergson) · 그래디언트를 이용해 어떤 학습 문서가 모델 출력에 영향을 줬는지 계산하는 도구
- LoRA · 모델 전체를 다시 학습시키지 않고 일부 작은 파라미터만 조정하는 경량 학습 기법
레포 원문 소개 (영문)
Training-data attribution as a discovery method for capability provenance in language models. COLM 2026.
GitHub에서 보기프로젝트 사이트관련 기사
주목받는 레포
- vorssaint/vorssaint-utils메뉴바 아이콘 하나로 유료 맥 앱 열 개 값을 대신하는 오픈소스 도구
- Alishahryar1/free-claude-code코딩 AI 에이전트를 무료 모델 49곳에 자유롭게 연결해주는 로컬 프록시
- freestylefly/awesome-gpt-image-2GPT-Image2로 원하는 이미지를 정확히 뽑아내는 프롬프트 설계도 532개를 모아놓은 저장소
- block/buzz사람과 AI 에이전트가 같은 채팅방에서 함께 일하는 오픈소스 협업 플랫폼
- NousResearch/hermes-agentNous Research가 만든, 쓰면 쓸수록 스스로 똑똑해지는 AI 에이전트 Hermes
- virgiliojr94/book-to-skill기술서 PDF를 AI 에이전트가 언제든 펼쳐볼 수 있는 '스킬'로 바꿔주는 도구
- VoltAgent/awesome-agent-skillsAI 코딩 도구가 특정 작업을 '전문가처럼' 하도록 도와주는 매뉴얼 1000개 이상을 한곳에 모았다
- anthropics/claude-plugins-community누구나 만든 Claude 확장 기능을 한곳에 모아 설치하게 해주는 저장소