시간이 지나며 갈라지고 합쳐지는 화제를 자동으로 추적하고, 왜 그렇게 판단했는지도 보여주는 방법
arXiv:2608.181012026-08-20
BERTilda: Explainable Topic Lifecycle Tracking with Split/Merge Detection via Similarity-and-Flow Temporal Graphs
시간이 지나며 갈라지고 합쳐지는 화제를 자동으로 추적하고, 왜 그렇게 판단했는지도 보여주는 방법
뉴스나 SNS의 화제는 그냥 서서히 변하는 게 아니라 어느 순간 두 갈래로 쪼개지거나(split), 여러 화제가 하나로 합쳐지기도(merge) 한다. BERTilda는 각 시간 구간마다 따로 뽑은 화제들을, 의미 유사도뿐 아니라 문서가 실제로 어디로 흘러가고 어디서 들어오는지를 함께 봐서 서로 연결하고, 이어짐/분열/합병/소멸/불분명 다섯 종류로 자동 라벨링한다. 미국 의회 의원들의 트윗 데이터로 검증한 결과 세 명의 사람 평가자 다수결 기준 최대 87퍼센트까지 일치했고, 비교 대상 방법들 중 가장 높은 평균 일치율을 보였다.
METAL MEDIA 해설 도표
시간이 지나며 갈라지고 합쳐지는 화제를 자동으로 추적하고, 왜 그렇게 판단했는지도 보여주는 방법
01문제의식: 기존 동적 토픽 모델은 화제가 부드럽게 서서히 바뀐다고 가정하고, 매 구간마다 따로 화제를 뽑는 스냅샷 모델은 서로 다른 구간의 화제를 어떻게 연결할지 알려주지 않는다
02방법: 각 시간 구간에서 BERTopic으로 화제를 독립적으로 뽑은 뒤, 두 신호로 인접 구간의 화제를 연결한다 -- (1) 화제 임베딩 간 의미적 유사도, (2) 문서가 다음 구간 어느 화제로 빠져나가는지(outflow)와 이전 구간 어느 화제에서 들어왔는지(inflow)를 양방향으로 계산하는 커버리지 신호
03이렇게 만든 방향 그래프에 투명한 규칙을 적용해 이어짐, 분열, 합병, 소멸, 불분명 다섯 가지 사건으로 라벨을 붙이고 시간에 따른 화제 그래프를 완성한다
04검증: 제119대 미국 의회 544명 계정의 트윗 357,896건과 유엔총회 연설, 국정연설 데이터를 사용했고, 3명의 독립 평가자가 무작위로 뽑은 120개 사건(유형별 30개)을 검토했다
05결과: BERTilda는 평가자 다수결 검증률(정밀도) 매크로 평균 0.775로, 유사도만 쓰는 방법(0.571)과 정방향 흐름만 쓰는 방법(0.725)보다 높았고, 특히 소멸(disappearance) 탐지에서 강점을 보였다. 임계값을 조금씩 바꿔도 매크로 평균이 0.663~0.718 범위를 유지해 특정 설정에 과도하게 의존하지 않음을 보였다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.
무엇을 했나
문제의식: 기존 동적 토픽 모델은 화제가 부드럽게 서서히 바뀐다고 가정하고, 매 구간마다 따로 화제를 뽑는 스냅샷 모델은 서로 다른 구간의 화제를 어떻게 연결할지 알려주지 않는다
방법: 각 시간 구간에서 BERTopic으로 화제를 독립적으로 뽑은 뒤, 두 신호로 인접 구간의 화제를 연결한다 -- (1) 화제 임베딩 간 의미적 유사도, (2) 문서가 다음 구간 어느 화제로 빠져나가는지(outflow)와 이전 구간 어느 화제에서 들어왔는지(inflow)를 양방향으로 계산하는 커버리지 신호
이렇게 만든 방향 그래프에 투명한 규칙을 적용해 이어짐, 분열, 합병, 소멸, 불분명 다섯 가지 사건으로 라벨을 붙이고 시간에 따른 화제 그래프를 완성한다
검증: 제119대 미국 의회 544명 계정의 트윗 357,896건과 유엔총회 연설, 국정연설 데이터를 사용했고, 3명의 독립 평가자가 무작위로 뽑은 120개 사건(유형별 30개)을 검토했다
결과: BERTilda는 평가자 다수결 검증률(정밀도) 매크로 평균 0.775로, 유사도만 쓰는 방법(0.571)과 정방향 흐름만 쓰는 방법(0.725)보다 높았고, 특히 소멸(disappearance) 탐지에서 강점을 보였다. 임계값을 조금씩 바꿔도 매크로 평균이 0.663~0.718 범위를 유지해 특정 설정에 과도하게 의존하지 않음을 보였다
Table 1: Datasets and temporal segmentation used in experiments.
Dataset
Domain
Time span
Unit
Windowing
Congress tweets
social media
2024–2025
tweet
7d window, 3d step
UN General Debates
speeches
1970–2015
paragraph/speech
3y window, 2y step
State of the Union
speeches
1790–2018
paragraph/speech
7y window, 3y step
Table 2: Default decision thresholds used in the alignment and event-labeling stages. Dataset-specific window size and step are described in the experimental setup.
Symbol
Meaning
Value
Similarity and edge validation
τdoc
min doc-to-topic similarity for attribution
0.40
τtopic
min topic-to-topic similarity for candidate edge
0.70
τcovout=τcovin
min coverage for a validated edge
0.30
Event-labeling thresholds
αcont
continuation similarity threshold
0.90
αcontout=αcontin
min inflow/outflow coverage for continuation
0.50
αsplitout
min total outflow coverage for split
0.70
αsplitin
min inflow coverage per successor
0.50
αdispout=αdispin
min inflow/outflow coverage for disappearance
0.40
αmergeout
min outflow coverage per predecessor
0.50
αmergein
min total inflow coverage for merge target
0.70
Table 3: Static topic quality metrics on the congressional tweets dataset.
Model
CV
NPMI
UMass
Diversity
TQ
BERTilda (BERTopic + temporal graph)
0.7381
0.1981
-2.8489
0.9751
0.7200
Top2Vec
0.3565
−0.3005
−11.5995
0.8937
0.3184
Table 4: Distribution of predicted event labels on the 120 annotated gold-set items.
Method
Continue
Disappear
Split
Merge
BERTilda (similarity + bidirectional coverage)
30
30
30
30
Similarity-only (normalized topic similarity)
20
48
21
20
Lexical-only (normalized c-TF-IDF similarity)
4
106
0
0
Forward-only (no backward attribution)
20
48
20
21
Table 5: Annotator-confirmed validation rate (precision) on predicted events, using majority vote across three annotators.
Method
Continue
Disappear
Split
Merge
BERTilda (similarity + bidirectional coverage)
0.867
0.800
0.767
0.667
Similarity-only (normalized topic similarity)
0.750
0.417
0.667
0.450
Lexical-only (normalized c-TF-IDF similarity)
0.750
0.226
n/a
n/a
Forward-only (no backward attribution)
0.800
0.558
0.826
0.714
Table 6: Overall topic quality metrics on UN General Debates (mean ± std across windows).
Model
CV
NPMI
UMass
Diversity
TQ
BERTilda
0.593 ± 0.066
0.084 ± 0.044
-1.105 ± 0.776
0.921 ± 0.074
0.551 ± 0.095
Tomotopy DTM
0.361 ± 0.037
-0.030 ± 0.013
-0.697 ± 0.614
0.589 ± 0.067
0.211 ± 0.019
DETM
0.542 ± 0.012
–
–
0.998 ± 0.000
0.541 ± 0.012
Table 7: Temporal drift on UN General Debates (drift = β1).
Model
Metric
Drift
p-value
BERTilda
CV
0.0007
0.5635
Diversity
0.0051
0.0062
TQ
0.0031
0.1062
Tomotopy DTM
CV
0.0009
0.0204
Diversity
0.0016
0.0310
TQ
0.0010
2.05e-09
DETM
CV
2.13e-04
0.1215
Diversity
-1.53e-07
0.9717
TQ
2.13e-04
0.1219
왜 중요한가
정치인 발언, 뉴스, SNS처럼 시간에 따라 이야기가 계속 갈라지고 합쳐지는 텍스트를 분석할 때, 왜 그런 판단을 내렸는지 사람이 검증 가능한 근거(문서 흐름)와 함께 보여준다는 점이 중요하다. 블랙박스 딥러닝 모델과 달리 분석가가 그래프를 직접 열어보고 사건 판정의 이유를 확인하고 오류를 고칠 수 있다.
이 논문의 용어
스냅샷 토픽 모델 · 전체 흐름을 한 번에 보지 않고 특정 시간 구간의 문서만 따로 모아 화제를 뽑는 방식
outflow/inflow(양방향 커버리지) · 한 화제의 문서들이 다음 구간 어느 화제로 옮겨가는지(outflow), 반대로 어느 화제에서 흘러들어왔는지(inflow)를 세는 지표
BERTopic · 문장 임베딩과 클러스터링, 키워드 추출을 결합해 화제를 뽑아내는 오픈소스 토픽 모델링 도구
본문에 싣지 못한 그림
Figure 1: Representative local threshold-sensitivity analyses on the congressional gold set. Left: varying τdoc. Right: varying αdispout. Full curves for all five thresholds are reported in the supplementary material.
Figure 2: Example temporal evolution of a topic (Holocaust/Israel–Antisemitism), illustrating split, continuations, and disappearance across consecutive windows.