AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다
arXiv:2608.195262026-08-21
Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023)
AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다
2023년 가을 조지워싱턴대에서 진행된 이 프로젝트는 뉴스, 위키피디아, 주가 데이터를 모아 LLM(대형언어모델)으로 자동 요약하는 시스템을 만들었다. Falcon-7B라는 오픈소스 모델에 '통째로 요약(Summarize Chains)' 방식을 쓴 결과가 가장 정확하고 자연스러웠던 반면, 요즘 유행하는 RAG(검색 후 생성) 방식은 같은 내용을 반복하거나 없는 사실을 지어내는 문제를 보였다. 주가 숫자는 미리 문장으로 변환해 GPT에 넘기는 방식으로 계산 오류 없이 깔끔한 요약을 만들어냈다.
METAL MEDIA 해설 도표
AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다
01애플, 구글, 테슬라 등 10개 기업을 대상으로 뉴스 API, 위키피디아, 야후 파이낸스에서 데이터를 모으는 파이프라인을 구축했다
02LLM이 숫자표를 못 다루는 문제를 풀기 위해, 주가 변화율을 파이썬에서 미리 계산해 '10월 4일 테슬라는 261.16달러로 마감, 5.93% 상승' 같은 문장으로 바꿔 모델에 입력했다
03뉴스 요약은 '한 번에 요약(Summarize Chains)'과 '검색 후 생성(RAG)' 두 방식을 Falcon-7B, DistilBART, BART-Large 세 모델로 비교했다
04Falcon-7B의 Summarize Chains 방식이 구글 관련 뉴스 3개 사건을 모두 정확하고 매끄럽게 담아낸 반면, RAG는 같은 내용을 60번 넘게 반복하거나(Falcon) 없는 사실을 지어내는(BART-Large) 문제를 보였다
05두 LLM 방식 모두 첫 세 문장만 뽑는 단순 기준선(Lead-3)보다 ROUGE-1 점수가 높았다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.
무엇을 했나
애플, 구글, 테슬라 등 10개 기업을 대상으로 뉴스 API, 위키피디아, 야후 파이낸스에서 데이터를 모으는 파이프라인을 구축했다
LLM이 숫자표를 못 다루는 문제를 풀기 위해, 주가 변화율을 파이썬에서 미리 계산해 '10월 4일 테슬라는 261.16달러로 마감, 5.93% 상승' 같은 문장으로 바꿔 모델에 입력했다
뉴스 요약은 '한 번에 요약(Summarize Chains)'과 '검색 후 생성(RAG)' 두 방식을 Falcon-7B, DistilBART, BART-Large 세 모델로 비교했다
Falcon-7B의 Summarize Chains 방식이 구글 관련 뉴스 3개 사건을 모두 정확하고 매끄럽게 담아낸 반면, RAG는 같은 내용을 60번 넘게 반복하거나(Falcon) 없는 사실을 지어내는(BART-Large) 문제를 보였다
두 LLM 방식 모두 첫 세 문장만 뽑는 단순 기준선(Lead-3)보다 ROUGE-1 점수가 높았다
Table 1: Dataset statistics: news articles collected per company via News API (7-day rolling window, September–October 2023).
Company (Ticker)
News Articles
Wikipedia Summary
Apple (AAPL)
≈97
Yes
Microsoft (MSFT)
≈85
Yes
Alphabet (GOOGL)
≈112
Yes
Amazon (AMZN)
≈78
Yes
Meta (META/FB)
≈91
Yes
Tesla (TSLA)
≈103
Yes
JPMorgan (JPM)
≈64
Yes
NVIDIA (NVDA)
≈88
Yes
Walmart (WMT)
≈52
Yes
Disney (DIS)
≈67
Yes
Total
≈837
10
Table 2: Language models evaluated in this study and their assigned tasks.
Model
Type
Access
Task
GPT (text-davinci-003)
Proprietary (OpenAI)
API
Stock data
Falcon-7B-Instruct
Open-source (TII)
HuggingFace Hub
News
DistilBART-CNN-12-6
Open-source (sshleifer)
HuggingFace Hub
News
BART-Large-XSum-SAMSum
Open-source (AdamCodd)
HuggingFace Hub
News
Table 3: ROUGE scores for news summarization (Google/GOOGL, 3 source articles as reference). Higher is better. Note: DistilBART Chains scores highest on ROUGE-1/2 due to extractive copying; Falcon Chains scores best on factual accuracy and coverage of all three events.
Model
Approach
ROUGE-1
ROUGE-2
ROUGE-L
DistilBART
Summarize Chains
0.4000
0.3456
0.2254
DistilBART
RAG
0.2523
0.1813
0.1201
Falcon-7B
Summarize Chains
0.3361
0.1828
0.1708
Falcon-7B
RAG
0.2281
0.1118
0.1579
BART-Large
Summarize Chains
0.2604
0.1786
0.2012
BART-Large
RAG
0.2553
0.1835
0.1459
Lead-3 Baseline
Extractive
0.2812
0.1943
0.1654
Table 4: ROUGE scores for stock data summarization using GPT (text-davinci-003) across 6 companies. Reference = structured-to-text transformed input.
Company
ROUGE-1
ROUGE-2
ROUGE-L
AAPL
0.4348
0.2206
0.2754
MSFT
0.4306
0.1972
0.2639
GOOGL
0.3269
0.0980
0.2885
TSLA
0.2913
0.0990
0.1942
AMZN
0.5098
0.3600
0.4902
META
0.2435
0.0531
0.1565
Mean
0.3728
0.1713
0.2781
Table 5: Qualitative evaluation. Coverage: events covered (out of 3). Accuracy: no hallucinated facts. Coherence: fluent and non-repetitive. ✓= passes criterion, × = fails.
Model
Approach
Coverage
Accuracy
Coherence
Key Issue
Falcon-7B
Chains
3/3
✓
✓
Best overall
DistilBART
Chains
2/3
✓
✓
Misses layoffs
DistilBART
RAG
2/3
✓
✓
Misses Russia fine
BART-Large
Chains
1/3
✓
×
Truncated output
BART-Large
RAG
2/3
×
✓
Hallucinated entity
Falcon-7B
RAG
3/3
✓
×
60× repetition
왜 중요한가
이 연구는 RAG가 만능이 아니며 작은 모델일수록 검색된 내용이 뒤섞이면 오히려 없는 사실을 지어낼 위험이 크다는 것을 보여준다. 금융 뉴스처럼 정확성이 중요한 분야에서 AI 요약 도구를 도입할 때, 화려한 최신 기법보다 상황에 맞는 단순한 방법이 더 안전할 수 있다는 실무적 교훈을 준다.
이 논문의 용어
LLM (대형언어모델) · 대량의 텍스트로 학습되어 사람처럼 글을 생성하는 AI 모델
RAG (검색 증강 생성) · 질문과 관련된 자료를 먼저 찾아온 뒤 그 내용을 참고해 답을 생성하는 방식
Summarize Chains · 긴 문서를 조각내 각각 요약한 뒤 그 요약들을 다시 합쳐 최종 요약을 만드는 방식
환각(hallucination) · AI가 사실이 아닌 내용을 그럴듯하게 지어내는 현상
ROUGE 점수 · 생성된 요약문이 원문과 단어를 얼마나 겹치게 사용했는지 측정하는 자동 평가 지표
FAISS · 메타(Meta)가 만든, 비슷한 의미의 문장을 빠르게 찾아주는 검색 라이브러리