말로 주식 조건을 말하면 AI가 검증된 SQL 쿼리로 바꿔주는 시스템
말로 주식 조건을 말하면 AI가 검증된 SQL 쿼리로 바꿔주는 시스템
StocksTalk는 사람이 음성으로 말한 주식 스크리닝 조건(예: PER 25 이하 대형 IT주)을 실행 가능한 SQL 쿼리로 바꿔주는 대화형 시스템이다. 음성인식, 검색증강 조건 추출, 스키마 기반 SQL 생성, 규칙 기반 검증, 사람 확인 절차를 하나의 대시보드로 묶었다. 150개의 음성 프롬프트로 실험한 결과, 이 구조 전체가 단순 GPT-4o 사용보다 논리적 일관성과 다중 턴 안정성에서 큰 폭으로 앞섰다.
METAL MEDIA 해설 도표
말로 주식 조건을 말하면 AI가 검증된 SQL 쿼리로 바꿔주는 시스템
- 01음성으로 말한 투자 조건(예: 배당수익률, PER, 부채비율 등)을 실시간 주식 데이터에 대한 SQL 쿼리로 변환하는 파이프라인을 만들었다
- 02음성인식(ElevenLabs) → 검색증강 조건 추출(RAG) → 스키마 기반 GPT-4o SQL 생성 → 규칙 기반 검증 → 사람이 최종 확인하는 4단계 구조로 설계했으며, 각 단계의 중간 결과를 대시보드에 그대로 보여줘 사용자가 확인·수정할 수 있게 했다
- 03성장주·배당주·가치주 3개 카테고리, 조용한 환경과 시끄러운 환경 2가지 조건으로 총 150개 음성 프롬프트(300개 음성 샘플) 벤치마크를 직접 만들어 공개할 예정이다
- 04조건 추출 정확도, SQL 실행 가능성, 논리적 일관성, 쿼리 편집거리, 다중 턴 안정성 등의 지표로 평가한 결과, 사람 검증까지 포함한 전체 시스템이 아무 검증 장치 없는 일반 GPT-4o보다 논리적 일관성 27.8퍼센트포인트, 다중 턴 안정성 37.4퍼센트포인트 더 높았다
- 05검증 단계를 하나씩 빼보는 실험에서 검색증강은 조건 추출에, 제약된 생성 방식은 실행 가능성에, 규칙 기반 검증은 논리적 일관성에 각각 서로 다른 역할을 한다는 것을 확인했고, 사람이 직접 확인하는 절차는 특히 여러 번 대화를 주고받는 상황에서 오류가 누적되는 것을 크게 줄였다(검증 없이는 34%가 오류를 이어받았지만 검증 시 9%로 감소)
무엇을 했나
- 음성으로 말한 투자 조건(예: 배당수익률, PER, 부채비율 등)을 실시간 주식 데이터에 대한 SQL 쿼리로 변환하는 파이프라인을 만들었다
- 음성인식(ElevenLabs) → 검색증강 조건 추출(RAG) → 스키마 기반 GPT-4o SQL 생성 → 규칙 기반 검증 → 사람이 최종 확인하는 4단계 구조로 설계했으며, 각 단계의 중간 결과를 대시보드에 그대로 보여줘 사용자가 확인·수정할 수 있게 했다
- 성장주·배당주·가치주 3개 카테고리, 조용한 환경과 시끄러운 환경 2가지 조건으로 총 150개 음성 프롬프트(300개 음성 샘플) 벤치마크를 직접 만들어 공개할 예정이다
- 조건 추출 정확도, SQL 실행 가능성, 논리적 일관성, 쿼리 편집거리, 다중 턴 안정성 등의 지표로 평가한 결과, 사람 검증까지 포함한 전체 시스템이 아무 검증 장치 없는 일반 GPT-4o보다 논리적 일관성 27.8퍼센트포인트, 다중 턴 안정성 37.4퍼센트포인트 더 높았다
- 검증 단계를 하나씩 빼보는 실험에서 검색증강은 조건 추출에, 제약된 생성 방식은 실행 가능성에, 규칙 기반 검증은 논리적 일관성에 각각 서로 다른 역할을 한다는 것을 확인했고, 사람이 직접 확인하는 절차는 특히 여러 번 대화를 주고받는 상황에서 오류가 누적되는 것을 크게 줄였다(검증 없이는 34%가 오류를 이어받았지만 검증 시 9%로 감소)

| System | CEA (%) | EX (%) | LCR (%) | QED | MTS (%) | LAT (s) |
|---|---|---|---|---|---|---|
| GPT-4o (plain) | 63.4 | 81.2 | 54.7 | 8.3 | 51.2 | 1.5±0.1 |
| GPT-4o + RAG | 79.8 | 88.6 | 67.3 | 5.1 | 68.4 | 2.1±0.2 |
| GPT-4o + RAG + Validation | 88.3 | 96.9 | 91.2 | 2.8 | 82.7 | 2.3±0.2 |
| StocksTalk (full) | 91.2 | 97.5 | 93.8 | 2.1 | 88.6 | 3.1±0.4 |
| Metric | Clean Input | Noisy Input |
|---|---|---|
| Constraint Extraction Acc. (%) | 91.2 | 78.4 |
| SQL Executability (%) | 97.5 | 89.3 |
| Logical Consistency Rate (%) | 93.8 | 82.1 |
| Query Edit Distance (tokens) | 2.1 | 5.7 |
| Multi-turn Stability (%) | 88.6 | 74.3 |
| Avg. End-to-End Latency (s) | 3.1±0.4 | 3.6±0.7 |
| Configuration | CEA (%) | EX (%) | LCR (%) |
|---|---|---|---|
| Full system | 91.2 | 97.5 | 93.8 |
| w/o RAG retrieval | 74.3 (−16.9) | 95.1 (−2.4) | 87.2 (−6.6) |
| w/o validation layer | 90.8 (−0.4) | 96.9 (−0.6) | 71.4 (−22.4) |
| w/o constrained decoding | 88.5 (−2.7) | 79.2 (−18.3) | 84.3 (−9.5) |
| w/o human-in-the-loop | 89.1 (−2.1) | 94.3 (−3.2) | 80.6 (−13.2) |
| Prompt Type | w/o HITL | w/ HITL | Gain |
|---|---|---|---|
| Growth-focused | 94.2 | 98.6 | +4.4 |
| Dividend-oriented | 91.7 | 97.3 | +5.6 |
| Value-based | 88.3 | 96.8 | +8.5 |
| Overall | 91.4 | 97.5 | +6.1 |
왜 중요한가
말로 복잡한 검색 조건을 지시하고 그대로 실행 가능한 쿼리로 바꾸는 일은 은행, 증권사, 데이터 서비스처럼 자연어 인터페이스를 만드는 곳에 바로 적용될 수 있는 실용적 사례다. 특히 중간 과정을 사용자에게 그대로 보여주고 고칠 수 있게 한 설계는, AI가 틀렸을 때 사람이 어디서 개입해야 하는지 보여주는 참고 모델이 된다.
이 논문의 용어
- RAG(검색증강생성) · 질문에 답하기 전에 관련 문서나 지식을 검색해 함께 참고하도록 하는 AI 기법
- SQL · 데이터베이스에서 원하는 조건의 데이터를 조회할 때 쓰는 질의 언어
- human-in-the-loop(사람 개입 검증) · AI가 만든 결과를 실행하기 전에 사람이 확인하거나 고치도록 하는 절차
- ASR(음성인식) · 사람이 말한 음성을 텍스트로 변환하는 기술
- 스키마 기반 프롬프팅 · 데이터베이스의 표 구조(스키마)를 AI에게 알려줘서 그 구조에 맞는 쿼리만 만들도록 유도하는 방법
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Akshat Parmar et al., arXiv:2608.18105, CC BY 4.0