석유공학자 모임에 배치된 AI 동료, ATHENA가 실전 배치까지 이어진 이야기
석유공학자 모임에 배치된 AI 동료, ATHENA가 실전 배치까지 이어진 이야기
ATHENA는 석유가스 업계 전문가 커뮤니티를 위해 만든 챗봇형 AI 비서로, 정보 검색과 통찰(insight) 공유를 사람처럼 자연스럽게 돕는다. 초기 프로토타입 평가에서 기존 최신 RAG(검색 결합 생성) 시스템보다 작업 점수 152%, 생산성 283% 향상을 보였고, 이번 논문은 여러 문서를 종합하는 검색, 답변 검증, 더 정교한 통찰 추천 기능을 추가해 실제 SPE(Society of Petroleum Engineers) 연구 포털에 배치하기까지의 과정을 다룬다. 후속 평가에서도 기존 최신 RAG 대비 평균 점수 216% 향상, 실패율 0%, 생산성 215% 향상이라는 결과를 얻었다.
METAL MEDIA 해설 도표
석유공학자 모임에 배치된 AI 동료, ATHENA가 실전 배치까지 이어진 이야기
- 01석유가스 산업 전문가 커뮤니티를 위해 질문에 답하고, 현장 경험(통찰)을 수집·공유하며, 사용자 수준에 맞춰 필요한 정보를 먼저 알려주는 AI 비서 ATHENA를 개발했다.
- 02기존 방식은 키워드 검색이나 벡터 임베딩 검색 한 가지에 의존했지만, ATHENA는 질문을 여러 방식으로 재해석하고 위치·주제·문서 유형으로 태그를 붙인 뒤 이를 필터로 활용하는 '다중 가설 검색'을 도입해 검색 정확도(MRR)를 0.687로 끌어올렸다(비교 대상 임베딩 모델은 0.412, 0.376).
- 03수백 개 문서에 흩어진 정보를 한 번에 모아 답하는 '배치 문서 읽기' 에이전트, 답변에 쓰인 문장의 페이지·인용문을 바로 확인할 수 있는 문서 뷰어를 추가해 정확성과 검증 가능성을 높였다.
- 04사용자의 배경·행동·현재 작업을 반영하는 '사용자 역량 벡터'를 만들어 통찰 추천을 개인화했고, 그 결과 관련성 순위 지표(MRR)가 기존 방식 대비 500% 개선되고 필요한 추천 개수는 84% 줄었다.
- 05비전문가 13명을 대상으로 한 평가에서 ATHENA는 기존 최신 RAG 기준 시스템 대비 평균 작업 점수 216%, 생산성 215% 향상, 실패율 100% 감소, 사용성 점수(KM-SUS) 28% 향상을 기록했고, 2025년 6월 SPE 연구 포털에 우선 사용자 25명에게 배치되었으며 2025년 4분기 전체 회원 확대가 예정되어 있다.
무엇을 했나
- 석유가스 산업 전문가 커뮤니티를 위해 질문에 답하고, 현장 경험(통찰)을 수집·공유하며, 사용자 수준에 맞춰 필요한 정보를 먼저 알려주는 AI 비서 ATHENA를 개발했다.
- 기존 방식은 키워드 검색이나 벡터 임베딩 검색 한 가지에 의존했지만, ATHENA는 질문을 여러 방식으로 재해석하고 위치·주제·문서 유형으로 태그를 붙인 뒤 이를 필터로 활용하는 '다중 가설 검색'을 도입해 검색 정확도(MRR)를 0.687로 끌어올렸다(비교 대상 임베딩 모델은 0.412, 0.376).
- 수백 개 문서에 흩어진 정보를 한 번에 모아 답하는 '배치 문서 읽기' 에이전트, 답변에 쓰인 문장의 페이지·인용문을 바로 확인할 수 있는 문서 뷰어를 추가해 정확성과 검증 가능성을 높였다.
- 사용자의 배경·행동·현재 작업을 반영하는 '사용자 역량 벡터'를 만들어 통찰 추천을 개인화했고, 그 결과 관련성 순위 지표(MRR)가 기존 방식 대비 500% 개선되고 필요한 추천 개수는 84% 줄었다.
- 비전문가 13명을 대상으로 한 평가에서 ATHENA는 기존 최신 RAG 기준 시스템 대비 평균 작업 점수 216%, 생산성 215% 향상, 실패율 100% 감소, 사용성 점수(KM-SUS) 28% 향상을 기록했고, 2025년 6월 SPE 연구 포털에 우선 사용자 25명에게 배치되었으며 2025년 4분기 전체 회원 확대가 예정되어 있다.

왜 중요한가
이 연구는 특정 산업(석유가스)에서 방대한 문서와 현장 경험을 다루는 AI 비서가 실험실 수준을 넘어 실제 132,000명 규모의 전문가 단체 서비스로 배치된 드문 사례를 보여준다. AI 검색·추천 시스템을 설계하거나 도입을 검토하는 사람에게, 검증 가능성과 신뢰 확보, 배치까지의 조직적 과정이 기술만큼 중요하다는 것을 보여주는 참고 사례가 된다.

이 논문의 용어
- RAG(검색 결합 생성) · 질문과 관련된 문서를 먼저 찾은 뒤 그 내용을 참고해 답을 생성하는 AI 기법
- MRR(평균 역순위) · 정답 문서가 검색 결과 상위에 얼마나 잘 위치했는지를 나타내는 지표, 높을수록 좋음
- 임베딩 · 문장이나 문서를 숫자 벡터로 바꿔 의미가 비슷한 것끼리 가깝게 배치하는 방식
- 에이전틱 AI · 하나의 큰 모델이 아니라 여러 역할을 맡은 AI 에이전트들이 협력해 작업을 수행하는 방식
- KM-SUS · 지식관리 시스템의 사용성을 측정하기 위해 새로 개발된 평가 척도
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: John Boden et al., arXiv:2608.19199, arxiv-nonexclusive