컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다

arXiv:2608.195262026-08-21

Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023)

AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다

2023년 가을 조지워싱턴대에서 진행된 이 프로젝트는 뉴스, 위키피디아, 주가 데이터를 모아 LLM(대형언어모델)으로 자동 요약하는 시스템을 만들었다. Falcon-7B라는 오픈소스 모델에 '통째로 요약(Summarize Chains)' 방식을 쓴 결과가 가장 정확하고 자연스러웠던 반면, 요즘 유행하는 RAG(검색 후 생성) 방식은 같은 내용을 반복하거나 없는 사실을 지어내는 문제를 보였다. 주가 숫자는 미리 문장으로 변환해 GPT에 넘기는 방식으로 계산 오류 없이 깔끔한 요약을 만들어냈다.

METAL MEDIA 해설 도표

AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다

  1. 01애플, 구글, 테슬라 등 10개 기업을 대상으로 뉴스 API, 위키피디아, 야후 파이낸스에서 데이터를 모으는 파이프라인을 구축했다
  2. 02LLM이 숫자표를 못 다루는 문제를 풀기 위해, 주가 변화율을 파이썬에서 미리 계산해 '10월 4일 테슬라는 261.16달러로 마감, 5.93% 상승' 같은 문장으로 바꿔 모델에 입력했다
  3. 03뉴스 요약은 '한 번에 요약(Summarize Chains)'과 '검색 후 생성(RAG)' 두 방식을 Falcon-7B, DistilBART, BART-Large 세 모델로 비교했다
  4. 04Falcon-7B의 Summarize Chains 방식이 구글 관련 뉴스 3개 사건을 모두 정확하고 매끄럽게 담아낸 반면, RAG는 같은 내용을 60번 넘게 반복하거나(Falcon) 없는 사실을 지어내는(BART-Large) 문제를 보였다
  5. 05두 LLM 방식 모두 첫 세 문장만 뽑는 단순 기준선(Lead-3)보다 ROUGE-1 점수가 높았다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 애플, 구글, 테슬라 등 10개 기업을 대상으로 뉴스 API, 위키피디아, 야후 파이낸스에서 데이터를 모으는 파이프라인을 구축했다
  2. LLM이 숫자표를 못 다루는 문제를 풀기 위해, 주가 변화율을 파이썬에서 미리 계산해 '10월 4일 테슬라는 261.16달러로 마감, 5.93% 상승' 같은 문장으로 바꿔 모델에 입력했다
  3. 뉴스 요약은 '한 번에 요약(Summarize Chains)'과 '검색 후 생성(RAG)' 두 방식을 Falcon-7B, DistilBART, BART-Large 세 모델로 비교했다
  4. Falcon-7B의 Summarize Chains 방식이 구글 관련 뉴스 3개 사건을 모두 정확하고 매끄럽게 담아낸 반면, RAG는 같은 내용을 60번 넘게 반복하거나(Falcon) 없는 사실을 지어내는(BART-Large) 문제를 보였다
  5. 두 LLM 방식 모두 첫 세 문장만 뽑는 단순 기준선(Lead-3)보다 ROUGE-1 점수가 높았다
Table 1: Dataset statistics: news articles collected per company via News API (7-day rolling window, September–October 2023).
Company (Ticker)News ArticlesWikipedia Summary
Apple (AAPL)≈97Yes
Microsoft (MSFT)≈85Yes
Alphabet (GOOGL)≈112Yes
Amazon (AMZN)≈78Yes
Meta (META/FB)≈91Yes
Tesla (TSLA)≈103Yes
JPMorgan (JPM)≈64Yes
NVIDIA (NVDA)≈88Yes
Walmart (WMT)≈52Yes
Disney (DIS)≈67Yes
Total≈83710
Table 2: Language models evaluated in this study and their assigned tasks.
ModelTypeAccessTask
GPT (text-davinci-003)Proprietary (OpenAI)APIStock data
Falcon-7B-InstructOpen-source (TII)HuggingFace HubNews
DistilBART-CNN-12-6Open-source (sshleifer)HuggingFace HubNews
BART-Large-XSum-SAMSumOpen-source (AdamCodd)HuggingFace HubNews
Table 3: ROUGE scores for news summarization (Google/GOOGL, 3 source articles as reference). Higher is better. Note: DistilBART Chains scores highest on ROUGE-1/2 due to extractive copying; Falcon Chains scores best on factual accuracy and coverage of all three events.
ModelApproachROUGE-1ROUGE-2ROUGE-L
DistilBARTSummarize Chains0.40000.34560.2254
DistilBARTRAG0.25230.18130.1201
Falcon-7BSummarize Chains0.33610.18280.1708
Falcon-7BRAG0.22810.11180.1579
BART-LargeSummarize Chains0.26040.17860.2012
BART-LargeRAG0.25530.18350.1459
Lead-3 BaselineExtractive0.28120.19430.1654
Table 4: ROUGE scores for stock data summarization using GPT (text-davinci-003) across 6 companies. Reference = structured-to-text transformed input.
CompanyROUGE-1ROUGE-2ROUGE-L
AAPL0.43480.22060.2754
MSFT0.43060.19720.2639
GOOGL0.32690.09800.2885
TSLA0.29130.09900.1942
AMZN0.50980.36000.4902
META0.24350.05310.1565
Mean0.37280.17130.2781
Table 5: Qualitative evaluation. Coverage: events covered (out of 3). Accuracy: no hallucinated facts. Coherence: fluent and non-repetitive. ✓= passes criterion, × = fails.
ModelApproachCoverageAccuracyCoherenceKey Issue
Falcon-7BChains3/3Best overall
DistilBARTChains2/3Misses layoffs
DistilBARTRAG2/3Misses Russia fine
BART-LargeChains1/3×Truncated output
BART-LargeRAG2/3×Hallucinated entity
Falcon-7BRAG3/3×60× repetition

왜 중요한가

이 연구는 RAG가 만능이 아니며 작은 모델일수록 검색된 내용이 뒤섞이면 오히려 없는 사실을 지어낼 위험이 크다는 것을 보여준다. 금융 뉴스처럼 정확성이 중요한 분야에서 AI 요약 도구를 도입할 때, 화려한 최신 기법보다 상황에 맞는 단순한 방법이 더 안전할 수 있다는 실무적 교훈을 준다.

이 논문의 용어

  • LLM (대형언어모델) · 대량의 텍스트로 학습되어 사람처럼 글을 생성하는 AI 모델
  • RAG (검색 증강 생성) · 질문과 관련된 자료를 먼저 찾아온 뒤 그 내용을 참고해 답을 생성하는 방식
  • Summarize Chains · 긴 문서를 조각내 각각 요약한 뒤 그 요약들을 다시 합쳐 최종 요약을 만드는 방식
  • 환각(hallucination) · AI가 사실이 아닌 내용을 그럴듯하게 지어내는 현상
  • ROUGE 점수 · 생성된 요약문이 원문과 단어를 얼마나 겹치게 사용했는지 측정하는 자동 평가 지표
  • FAISS · 메타(Meta)가 만든, 비슷한 의미의 문장을 빠르게 찾아주는 검색 라이브러리

저자 · Pranav Chandaliya

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사