프랑스 뉴스 기사를 7개 편집국 카테고리로 자동 분류하는 벤치마크, 신문사가 바뀌어도 꽤 잘 통한다
프랑스 뉴스 기사를 7개 편집국 카테고리로 자동 분류하는 벤치마크, 신문사가 바뀌어도 꽤 잘 통한다
연구자들은 13개 프랑스 언론사에서 87,637개 기사를 모아 URL 구조를 분석해 사회, 문화·여가, 국제, 정치, 스포츠, 경제, 과학·기술 등 7개 편집국 카테고리 체계를 만들었다. 프랑스어 특화 언어모델 CamemBERT를 이 데이터로 학습시켰더니 학습에 전혀 쓰지 않은 4개 언론사 기사에서도 macro-F1 0.799를 기록하며 대형 LLM(GPT-OSS-120B, Mistral, Llama-3.3-70B)보다 높은 재현율을 보였다. 다만 경제와 사회 카테고리는 신문사마다 편집 관행이 달라 사람도 헷갈리는 경계 영역으로 확인됐다.
METAL MEDIA 해설 도표
프랑스 뉴스 기사를 7개 편집국 카테고리로 자동 분류하는 벤치마크, 신문사가 바뀌어도 꽤 잘 통한다
- 01프랑스 13개 언론사(르몽드, 르피가로, 위마니테 등) 기사 87,637개를 모아 기사 URL의 섹션 이름(슬러그)을 분석해 7개 편집국 카테고리 체계를 설계했다.
- 02URL만으로 분류가 애매한 기사(전체의 27.8%)는 대형언어모델(GPT-OSS-120B)에게 맡겨 라벨을 붙이고, 사람 2명과 LLM 2명이 검증해 신뢰도를 확인했다.
- 03프랑스어 전용으로 학습된 CamemBERT 모델을 미세조정(fine-tuning)한 결과, 처음 보는 4개 언론사 기사 2,100개에서 macro-F1 0.799를 달성해 제로샷(사례 없이 바로 분류)으로 돌린 GPT-OSS-120B(0.758), Mistral Small 3.2(0.775), Llama-3.3-70B(0.771)를 모두 앞질렀다.
- 04경제 카테고리는 재현율 0.517로 가장 약했는데, 이는 사람이 봐도 신문사별 경제 기사 분류 기준이 제각각이라 55% 정도밖에 일치하지 않는 것과 비슷한 수준이라 모델의 한계라기보다 언론사 편집 관행 차이로 해석된다.
- 05학습된 모델과 라벨 데이터셋을 Hugging Face에 공개해 다른 연구자들이 프랑스 언론 다양성 분석, 의제 설정 연구 등에 바로 활용할 수 있게 했다.
무엇을 했나
- 프랑스 13개 언론사(르몽드, 르피가로, 위마니테 등) 기사 87,637개를 모아 기사 URL의 섹션 이름(슬러그)을 분석해 7개 편집국 카테고리 체계를 설계했다.
- URL만으로 분류가 애매한 기사(전체의 27.8%)는 대형언어모델(GPT-OSS-120B)에게 맡겨 라벨을 붙이고, 사람 2명과 LLM 2명이 검증해 신뢰도를 확인했다.
- 프랑스어 전용으로 학습된 CamemBERT 모델을 미세조정(fine-tuning)한 결과, 처음 보는 4개 언론사 기사 2,100개에서 macro-F1 0.799를 달성해 제로샷(사례 없이 바로 분류)으로 돌린 GPT-OSS-120B(0.758), Mistral Small 3.2(0.775), Llama-3.3-70B(0.771)를 모두 앞질렀다.
- 경제 카테고리는 재현율 0.517로 가장 약했는데, 이는 사람이 봐도 신문사별 경제 기사 분류 기준이 제각각이라 55% 정도밖에 일치하지 않는 것과 비슷한 수준이라 모델의 한계라기보다 언론사 편집 관행 차이로 해석된다.
- 학습된 모델과 라벨 데이터셋을 Hugging Face에 공개해 다른 연구자들이 프랑스 언론 다양성 분석, 의제 설정 연구 등에 바로 활용할 수 있게 했다.

| Family | Articles | % corpus | Publishers |
|---|---|---|---|
| International | 16,090 | 18.0% | 13/13 |
| Culture/Loisirs | 15,637 | 17.5% | 13/13 |
| Politique | 11,513 | 12.9% | 13/13 |
| Société | 11,234 | 12.6% | 13/13 |
| Économie | 8,233 | 9.2% | 13/13 |
| Sport | 7,178 | 8.0% | 13/13 |
| Sciences & Tech. | 3,144 | 3.5% | 10/13 |
| Environnement | 1,976 | 2.2% | 10/13 |
| Santé | 1,030 | 1.2% | 9/13 |
| Médias | 903 | 1.0% | 11/13 |
| Opinion/Édito | 873 | 1.0% | 6/13 |
| Régional | 1,366 | 1.5% | 5/13 |
| Format/Misc | 5,570 | 6.2% | 11/13 |

| Publisher | Articles | % | Type | Bucket A |
|---|---|---|---|---|
| Le Monde | 33,090 | 37.8 | NP | 63.2 |
| L’Express | 9,093 | 10.4 | NP | 82.6 |
| L’Humanité | 7,975 | 9.1 | NP | 68.6 |
| Le Point | 7,877 | 9.0 | NP | 87.6 |
| Le Figaro | 7,270 | 8.3 | NP | 63.0 |
| JDD | 7,269 | 8.3 | NP | 100.0 |
| La Croix | 1,910 | 2.2 | NP | 52.7 |
| Le HuffPost | 2,473 | 2.8 | DN | 84.0 |
| TF1 INFO | 2,044 | 2.3 | BR | 97.4 |
| Le Parisien | 2,375 | 2.7 | NP | 82.9 |
| Slate.fr | 2,105 | 2.4 | DN | 34.3 |
| 20 Minutes | 2,291 | 2.6 | DN | 94.9 |
| Ouest-France | 1,865 | 2.1 | RP | 39.0 |
| Total | 87,637∗ | 100 | 13 |

| Category | Bucket A | Bucket B | Total | % |
|---|---|---|---|---|
| Société | 12,666 | 6,658 | 19,324 | 22.1% |
| International | 15,510 | 3,132 | 18,642 | 21.3% |
| Culture & Loisirs | 13,305 | 5,045 | 18,350 | 20.9% |
| Politique | 7,406 | 3,140 | 10,546 | 12.0% |
| Sport | 6,478 | 1,926 | 8,404 | 9.6% |
| Économie | 5,955 | 2,219 | 8,174 | 9.3% |
| Sciences & Technologies | 1,982 | 2,215 | 4,197 | 4.8% |
| Total | 63,302 | 24,335 | 87,637 | 100% |
| SHA-256 corpus fingerprint: c14a8ae609d009c9289393e6f0be761dda9f015aa4c17f515b09388742a2c218 |

| Model | Context | In-dist. Acc | In-dist. F1 | Cross-pub F1 |
|---|---|---|---|---|
| CamemBERT-base | 512 tok | 0.860 | 0.847 | 0.799 |
| CamemBERTav2 | 512 tok | 0.856 | 0.843 | — |
| CamemBERTav2 | 1,024 tok | 0.861 | 0.847 | 0.798 |
| Model A | Model B | Δ F1 | Bootstrap | McNemar | ||||
|---|---|---|---|---|---|---|---|---|
| p (Holm) | 95% CI | Sig. | χ2 | p (Holm) | Sig. | |||
| CamemBERT-v1 | CamemBERTav2 | +0.004 | 0.086 | [−0.002, 0.009] | 2.11 | 0.147 | ||
| CamemBERT-v1 | mBERT | +0.014 | <0.001 | [0.008, 0.020] | ∗ | 31.26 | <0.001 | ∗ |
| CamemBERT-v1 | TF-IDF | +0.035 | <0.001 | [0.029, 0.042] | ∗ | 152.34 | <0.001 | ∗ |
| CamemBERTav2 | mBERT | +0.010 | 0.001 | [0.005, 0.016] | ∗ | 18.91 | <0.001 | ∗ |
| CamemBERTav2 | TF-IDF | +0.032 | <0.001 | [0.025, 0.038] | ∗ | 128.90 | <0.001 | ∗ |
| mBERT | TF-IDF | +0.021 | <0.001 | [0.015, 0.028] | ∗ | 56.70 | <0.001 | ∗ |
왜 중요한가
프랑스어 뉴스에서 언론사를 넘나드는 자동 분류기가 없었던 공백을 채워, 여러 매체의 보도 경향을 한꺼번에 비교하는 미디어 연구에 실질적인 도구를 제공한다. 대형 범용 LLM보다 작고 특화된 모델이 특정 실무 과제에서 더 낫다는 것을 실증한 사례이기도 하다.
이 논문의 용어
- CamemBERT · 프랑스어 텍스트 약 138GB로 사전학습된 프랑스어 전용 언어모델
- 슬러그(slug) · 기사 URL 경로에 포함된 섹션 이름 조각, 예: lemonde.fr/politique/
- macro-F1 · 각 카테고리별 정확도를 동일 가중치로 평균낸 전체 성능 지표
- 제로샷(zero-shot) · 별도 예시 없이 설명만 주고 바로 분류를 시키는 방식
- held-out(홀드아웃) · 모델 학습에 전혀 쓰이지 않고 평가에만 사용하는 데이터
본문에 싣지 못한 그림
- Figure 5: Top-10 tokens per class by aggregated Integrated Gradients attribution score (199-article stratified sample, CamemBERT-base full-text model). All leading tokens are topically interpretable; no publisher-identifying surface marker appears in any top-10 list.
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Amr Sobhy et al., arXiv:2608.18097, CC BY 4.0