컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

elder-plinius/OBLITERATUS

7,787오늘 +63Python

AI 모델이 '이건 답 못해요' 하고 거절하는 기능만 골라내서 지우는 오픈소스 도구

OBLITERATUS는 거대언어모델(LLM) 내부에서 유해하거나 민감한 요청을 거절하도록 만드는 신호를 찾아내 수술하듯 제거하는 파이썬 도구다. 재학습 없이 모델 가중치의 특정 방향(벡터)만 지워서 거절 행동만 없애고 언어 능력은 그대로 유지하는 것을 목표로 한다. 웹 UI, 코랩, 명령줄, 파이썬 API 등 여섯 가지 방식으로 쓸 수 있고, 사용할 때마다 익명 벤치마크 데이터를 커뮤니티 데이터셋에 보태는 구조도 갖췄다.

무엇을 하는 레포인가

  1. 거절 행동을 만드는 내부 표현(활성화 벡터)의 방향을 PCA, 평균차이, SVD 등 여러 방법으로 찾아내고 이를 가중치에서 빼내는 방식(abliteration)으로 모델을 수정한다
  2. SUMMON(모델 불러오기) → PROBE(활성화 수집) → DISTILL(방향 추출) → EXCISE(방향 제거) → VERIFY(성능 확인) → REBIRTH(저장)의 6단계 파이프라인으로 동작하며, 15개 분석 모듈로 거절 신호가 어느 층에 몰려 있는지, 제거 후 스스로 복구되는지(우로보로스 효과) 등을 미리 진단한다
  3. basic부터 nuclear까지 7단계 강도의 가중치 수정 방식과, 가중치를 건드리지 않고 추론 시점에만 방향을 조정하는 되돌릴 수 있는 steering vector 방식을 모두 지원한다
  4. 허깅페이스 스페이스, 로컬 웹 UI, 구글 코랩, CLI, 파이썬 API, YAML 설정 파일까지 6가지 사용 경로를 제공하고, GPT-2부터 수백억 파라미터급 모델까지 116개 사전 등록 모델과 다중 GPU 분산 실행을 지원한다
  5. 사용자가 원하면 실행 결과(모델명, 방법, 성능 지표, 하드웨어 정보)를 익명으로 커뮤니티 데이터셋에 보내 크로스 아키텍처 거절 방향 연구에 기여하는 텔레메트리 기능이 있다

왜 중요한가

정렬(alignment) 연구자나 레드팀에게는 안전장치가 실제로 모델 가중치의 어디에 어떻게 새겨지는지 직접 들여다볼 수 있는 실험 도구가 된다. 다만 이 도구로 만든 모델은 원래라면 거절했을 내용도 생성하므로, 사용 목적과 책임 소재를 스스로 판단해야 한다.

이 레포의 용어

  • abliteration · 모델을 재학습하지 않고 내부 가중치에서 거절을 유발하는 방향만 골라 제거하는 기법
  • SVD(특이값분해) · 행렬을 분해해 데이터의 주요 방향(패턴)을 찾아내는 수학적 방법
  • steering vector · 모델 가중치를 바꾸지 않고 추론 중에만 특정 방향으로 활성화를 밀어 행동을 바꾸는 벡터
  • 우로보로스 효과 · 거절 기능을 지워도 모델이 스스로 그 기능을 복구하려는 현상
  • 텔레메트리 · 사용자의 실행 결과를 익명으로 수집해 연구용 데이터셋에 모으는 기능

레포 원문 소개 (영문)

OBLITERATE THE CHAINS THAT BIND YOU

GitHub에서 보기

주목받는 레포

레포 전체 보기 →

METAL MEDIA 최신 기사