컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

시간이 지나며 갈라지고 합쳐지는 화제를 자동으로 추적하고, 왜 그렇게 판단했는지도 보여주는 방법

arXiv:2608.181012026-08-20

BERTilda: Explainable Topic Lifecycle Tracking with Split/Merge Detection via Similarity-and-Flow Temporal Graphs

시간이 지나며 갈라지고 합쳐지는 화제를 자동으로 추적하고, 왜 그렇게 판단했는지도 보여주는 방법

뉴스나 SNS의 화제는 그냥 서서히 변하는 게 아니라 어느 순간 두 갈래로 쪼개지거나(split), 여러 화제가 하나로 합쳐지기도(merge) 한다. BERTilda는 각 시간 구간마다 따로 뽑은 화제들을, 의미 유사도뿐 아니라 문서가 실제로 어디로 흘러가고 어디서 들어오는지를 함께 봐서 서로 연결하고, 이어짐/분열/합병/소멸/불분명 다섯 종류로 자동 라벨링한다. 미국 의회 의원들의 트윗 데이터로 검증한 결과 세 명의 사람 평가자 다수결 기준 최대 87퍼센트까지 일치했고, 비교 대상 방법들 중 가장 높은 평균 일치율을 보였다.

METAL MEDIA 해설 도표

시간이 지나며 갈라지고 합쳐지는 화제를 자동으로 추적하고, 왜 그렇게 판단했는지도 보여주는 방법

  1. 01문제의식: 기존 동적 토픽 모델은 화제가 부드럽게 서서히 바뀐다고 가정하고, 매 구간마다 따로 화제를 뽑는 스냅샷 모델은 서로 다른 구간의 화제를 어떻게 연결할지 알려주지 않는다
  2. 02방법: 각 시간 구간에서 BERTopic으로 화제를 독립적으로 뽑은 뒤, 두 신호로 인접 구간의 화제를 연결한다 -- (1) 화제 임베딩 간 의미적 유사도, (2) 문서가 다음 구간 어느 화제로 빠져나가는지(outflow)와 이전 구간 어느 화제에서 들어왔는지(inflow)를 양방향으로 계산하는 커버리지 신호
  3. 03이렇게 만든 방향 그래프에 투명한 규칙을 적용해 이어짐, 분열, 합병, 소멸, 불분명 다섯 가지 사건으로 라벨을 붙이고 시간에 따른 화제 그래프를 완성한다
  4. 04검증: 제119대 미국 의회 544명 계정의 트윗 357,896건과 유엔총회 연설, 국정연설 데이터를 사용했고, 3명의 독립 평가자가 무작위로 뽑은 120개 사건(유형별 30개)을 검토했다
  5. 05결과: BERTilda는 평가자 다수결 검증률(정밀도) 매크로 평균 0.775로, 유사도만 쓰는 방법(0.571)과 정방향 흐름만 쓰는 방법(0.725)보다 높았고, 특히 소멸(disappearance) 탐지에서 강점을 보였다. 임계값을 조금씩 바꿔도 매크로 평균이 0.663~0.718 범위를 유지해 특정 설정에 과도하게 의존하지 않음을 보였다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 문제의식: 기존 동적 토픽 모델은 화제가 부드럽게 서서히 바뀐다고 가정하고, 매 구간마다 따로 화제를 뽑는 스냅샷 모델은 서로 다른 구간의 화제를 어떻게 연결할지 알려주지 않는다
  2. 방법: 각 시간 구간에서 BERTopic으로 화제를 독립적으로 뽑은 뒤, 두 신호로 인접 구간의 화제를 연결한다 -- (1) 화제 임베딩 간 의미적 유사도, (2) 문서가 다음 구간 어느 화제로 빠져나가는지(outflow)와 이전 구간 어느 화제에서 들어왔는지(inflow)를 양방향으로 계산하는 커버리지 신호
  3. 이렇게 만든 방향 그래프에 투명한 규칙을 적용해 이어짐, 분열, 합병, 소멸, 불분명 다섯 가지 사건으로 라벨을 붙이고 시간에 따른 화제 그래프를 완성한다
  4. 검증: 제119대 미국 의회 544명 계정의 트윗 357,896건과 유엔총회 연설, 국정연설 데이터를 사용했고, 3명의 독립 평가자가 무작위로 뽑은 120개 사건(유형별 30개)을 검토했다
  5. 결과: BERTilda는 평가자 다수결 검증률(정밀도) 매크로 평균 0.775로, 유사도만 쓰는 방법(0.571)과 정방향 흐름만 쓰는 방법(0.725)보다 높았고, 특히 소멸(disappearance) 탐지에서 강점을 보였다. 임계값을 조금씩 바꿔도 매크로 평균이 0.663~0.718 범위를 유지해 특정 설정에 과도하게 의존하지 않음을 보였다
Table 1: Datasets and temporal segmentation used in experiments.
DatasetDomainTime spanUnitWindowing
Congress tweetssocial media2024–2025tweet7d window, 3d step
UN General Debatesspeeches1970–2015paragraph/speech3y window, 2y step
State of the Unionspeeches1790–2018paragraph/speech7y window, 3y step
Table 2: Default decision thresholds used in the alignment and event-labeling stages. Dataset-specific window size and step are described in the experimental setup.
SymbolMeaningValue
Similarity and edge validation
τdocmin doc-to-topic similarity for attribution0.40
τtopicmin topic-to-topic similarity for candidate edge0.70
τcovout=τcovinmin coverage for a validated edge0.30
Event-labeling thresholds
αcontcontinuation similarity threshold0.90
αcontout=αcontinmin inflow/outflow coverage for continuation0.50
αsplitoutmin total outflow coverage for split0.70
αsplitinmin inflow coverage per successor0.50
αdispout=αdispinmin inflow/outflow coverage for disappearance0.40
αmergeoutmin outflow coverage per predecessor0.50
αmergeinmin total inflow coverage for merge target0.70
Table 3: Static topic quality metrics on the congressional tweets dataset.
ModelCVNPMIUMassDiversityTQ
BERTilda (BERTopic + temporal graph)0.73810.1981-2.84890.97510.7200
Top2Vec0.3565−0.3005−11.59950.89370.3184
Table 4: Distribution of predicted event labels on the 120 annotated gold-set items.
MethodContinueDisappearSplitMerge
BERTilda (similarity + bidirectional coverage)30303030
Similarity-only (normalized topic similarity)20482120
Lexical-only (normalized c-TF-IDF similarity)410600
Forward-only (no backward attribution)20482021
Table 5: Annotator-confirmed validation rate (precision) on predicted events, using majority vote across three annotators.
MethodContinueDisappearSplitMerge
BERTilda (similarity + bidirectional coverage)0.8670.8000.7670.667
Similarity-only (normalized topic similarity)0.7500.4170.6670.450
Lexical-only (normalized c-TF-IDF similarity)0.7500.226n/an/a
Forward-only (no backward attribution)0.8000.5580.8260.714
Table 6: Overall topic quality metrics on UN General Debates (mean ± std across windows).
ModelCVNPMIUMassDiversityTQ
BERTilda0.593 ± 0.0660.084 ± 0.044-1.105 ± 0.7760.921 ± 0.0740.551 ± 0.095
Tomotopy DTM0.361 ± 0.037-0.030 ± 0.013-0.697 ± 0.6140.589 ± 0.0670.211 ± 0.019
DETM0.542 ± 0.0120.998 ± 0.0000.541 ± 0.012
Table 7: Temporal drift on UN General Debates (drift = β1).
ModelMetricDriftp-value
BERTildaCV0.00070.5635
Diversity0.00510.0062
TQ0.00310.1062
Tomotopy DTMCV0.00090.0204
Diversity0.00160.0310
TQ0.00102.05e-09
DETMCV2.13e-040.1215
Diversity-1.53e-070.9717
TQ2.13e-040.1219

왜 중요한가

정치인 발언, 뉴스, SNS처럼 시간에 따라 이야기가 계속 갈라지고 합쳐지는 텍스트를 분석할 때, 왜 그런 판단을 내렸는지 사람이 검증 가능한 근거(문서 흐름)와 함께 보여준다는 점이 중요하다. 블랙박스 딥러닝 모델과 달리 분석가가 그래프를 직접 열어보고 사건 판정의 이유를 확인하고 오류를 고칠 수 있다.

이 논문의 용어

  • 스냅샷 토픽 모델 · 전체 흐름을 한 번에 보지 않고 특정 시간 구간의 문서만 따로 모아 화제를 뽑는 방식
  • 임베딩 · 문장이나 단어의 의미를 숫자 벡터로 표현한 것
  • 코사인 유사도 · 두 벡터가 얼마나 비슷한 방향을 가리키는지로 유사성을 재는 척도
  • outflow/inflow(양방향 커버리지) · 한 화제의 문서들이 다음 구간 어느 화제로 옮겨가는지(outflow), 반대로 어느 화제에서 흘러들어왔는지(inflow)를 세는 지표
  • BERTopic · 문장 임베딩과 클러스터링, 키워드 추출을 결합해 화제를 뽑아내는 오픈소스 토픽 모델링 도구

본문에 싣지 못한 그림

  • Figure 1: Representative local threshold-sensitivity analyses on the congressional gold set. Left: varying τdoc. Right: varying αdispout. Full curves for all five thresholds are reported in the supplementary material.
  • Figure 2: Example temporal evolution of a topic (Holocaust/Israel–Antisemitism), illustrating split, continuations, and disappearance across consecutive windows.
원문에서 그림 보기 →

저자 · Cl\'audia Oliveira, \'Alvaro Figueira

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사