AI 논문 해설
매일 arXiv 에서 다섯 편을 골라 읽고, 무엇이 새로운지를 한국어로 풀어 씁니다.
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다AI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다
- 텍스트가 빠지거나 망가져도, AI가 그 자리를 대신할 '가짜 텍스트'를 한 번에 만들지 않고 여러 번 고쳐가며 감정을 더 정확히 읽어낸다텍스트가 빠지거나 망가져도, AI가 그 자리를 대신할 '가짜 텍스트'를 한 번에 만들지 않고 여러 번 고쳐가며 감정을 더 정확히 읽어낸다
- 러시아어로 1C 회계 소프트웨어 코드를 찾아주는 첫 검색 벤치마크와 전용 AI 모델이 나왔다러시아어로 1C 회계 소프트웨어 코드를 찾아주는 첫 검색 벤치마크와 전용 AI 모델이 나왔다
- 환자가 증상을 다 말하지 않아 애매한 질문에, AI가 먼저 되물어서 답을 맞히는 방법환자가 증상을 다 말하지 않아 애매한 질문에, AI가 먼저 되물어서 답을 맞히는 방법
- AI 채점관을 몇 명 불러야 하는지, 언제 멈춰야 하는지 정하는 방법AI 채점관을 몇 명 불러야 하는지, 언제 멈춰야 하는지 정하는 방법
- 영화 추천이나 판례 인용처럼 '기계 전용 코드'로 표현되는 정보도, LLM이 자연어와 함께 하나의 문장처럼 생성하게 만든 프레임워크영화 추천이나 판례 인용처럼 '기계 전용 코드'로 표현되는 정보도, LLM이 자연어와 함께 하나의 문장처럼 생성하게 만든 프레임워크
- AI 모델을 가볍게 압축하면 평균 점수는 그대로여도, 흔한 지식이 오히려 더 많이 사라지고 편향은 특정 집단에서 몰래 커진다AI 모델을 가볍게 압축하면 평균 점수는 그대로여도, 흔한 지식이 오히려 더 많이 사라지고 편향은 특정 집단에서 몰래 커진다
- 금융 AI가 서류체 문장에서 배운 자신감은 트위터로 가면 거짓말이 된다금융 AI가 서류체 문장에서 배운 자신감은 트위터로 가면 거짓말이 된다
- 항구에서 배와 크레인 일정을 짜는 알고리즘들이 '변수'에 얼마나 강한지 정리한 리뷰항구에서 배와 크레인 일정을 짜는 알고리즘들이 '변수'에 얼마나 강한지 정리한 리뷰
- 인터뷰형 대화 시스템을 테스트하려면 다양한 가상 사용자가 필요한데, LLM으로 그런 가짜 사용자 성격을 자동으로 만들어냈다인터뷰형 대화 시스템을 테스트하려면 다양한 가상 사용자가 필요한데, LLM으로 그런 가짜 사용자 성격을 자동으로 만들어냈다
- 시계열을 일정 구간으로 자르지 말고, 의미 단위로 잘라서 예측하자는 새 방법시계열을 일정 구간으로 자르지 말고, 의미 단위로 잘라서 예측하자는 새 방법
- 최신 AI 챗봇일수록 서로 비슷한 답을 내놓는다는 3년치 조사 결과최신 AI 챗봇일수록 서로 비슷한 답을 내놓는다는 3년치 조사 결과
- 로봇이 뒤죽박죽 실패 기록에서도 쓸모있는 동작만 골라 배우는 법로봇이 뒤죽박죽 실패 기록에서도 쓸모있는 동작만 골라 배우는 법
- 인도 소수언어 미조어 음성인식, 데이터 17시간 모으고 Whisper와 SraVaani로 학습시켜보니인도 소수언어 미조어 음성인식, 데이터 17시간 모으고 Whisper와 SraVaani로 학습시켜보니
- 엣지 기기에서 RAG 돌릴 때, 검색된 문서를 얼마나 압축할지 '실시간으로' 정해야 에너지를 아낄 수 있다엣지 기기에서 RAG 돌릴 때, 검색된 문서를 얼마나 압축할지 '실시간으로' 정해야 에너지를 아낄 수 있다
- 트랜스포머의 모든 어텐션 헤드가 같은 길이의 문맥을 볼 필요는 없다는 실험트랜스포머의 모든 어텐션 헤드가 같은 길이의 문맥을 볼 필요는 없다는 실험
- 논문 속에서 언급된 생물정보학 소프트웨어 이름을 AI가 자동으로 찾아내는 도구가 나왔다논문 속에서 언급된 생물정보학 소프트웨어 이름을 AI가 자동으로 찾아내는 도구가 나왔다
- LLM이 답을 낼 때마다 수백 번 다시 굴려보지 않아도, 통계 모델 하나면 '어디서 결정이 갈리는지'를 훨씬 싸게 알아낼 수 있다LLM이 답을 낼 때마다 수백 번 다시 굴려보지 않아도, 통계 모델 하나면 '어디서 결정이 갈리는지'를 훨씬 싸게 알아낼 수 있다
- 새 취약점이 계속 나와도 잊지 않고 하나의 모델로 합치는 스마트컨트랙트 취약점 탐지 AI새 취약점이 계속 나와도 잊지 않고 하나의 모델로 합치는 스마트컨트랙트 취약점 탐지 AI
- AI 생성 텍스트를 잡아내는 워터마크 기술이 영어 아닌 언어에서는 훨씬 부실하게 작동하고, 그 격차는 개별 언어가 아니라 언어 계열 단위로 나타난다AI 생성 텍스트를 잡아내는 워터마크 기술이 영어 아닌 언어에서는 훨씬 부실하게 작동하고, 그 격차는 개별 언어가 아니라 언어 계열 단위로 나타난다
- 로봇 AI가 '왜 안전한지'를 몰라도 되는 사고 정지 문제를, 위험했던 순간을 되감아 두 갈래 선택지로 가르쳐 해결하다로봇 AI가 '왜 안전한지'를 몰라도 되는 사고 정지 문제를, 위험했던 순간을 되감아 두 갈래 선택지로 가르쳐 해결하다
- 여러 AI 에이전트가 남긴 기억들이 사실은 같은 출처에서 복제된 것일 때, AI가 '가짜 다수결'에 속지 않게 만드는 법여러 AI 에이전트가 남긴 기억들이 사실은 같은 출처에서 복제된 것일 때, AI가 '가짜 다수결'에 속지 않게 만드는 법
- 이미지 노이즈 제거 GAN에서 채널끼리 정보를 나누게 했더니 성능이 올랐다이미지 노이즈 제거 GAN에서 채널끼리 정보를 나누게 했더니 성능이 올랐다
- AI 트레이더는 규칙을 안다고 말해도 실제 주문은 규칙을 어긴다AI 트레이더는 규칙을 안다고 말해도 실제 주문은 규칙을 어긴다
- 심장 CT 11개 구조물을 하나로 잇는 통계적 형상 모델, 복잡한 딥러닝보다 간단한 수식이 더 정확했다심장 CT 11개 구조물을 하나로 잇는 통계적 형상 모델, 복잡한 딥러닝보다 간단한 수식이 더 정확했다
- AI가 뇌영상 분석을 대신할 때, '왜 이 결론을 믿어도 되는가'까지 기록하게 만든 시스템AI가 뇌영상 분석을 대신할 때, '왜 이 결론을 믿어도 되는가'까지 기록하게 만든 시스템
- 문서 요약 AI 3종(BERT, RoBERTa, BART)을 같은 조건에서 직접 붙여본 결과, 글을 새로 써주는 BART가 압도적으로 앞섰다문서 요약 AI 3종(BERT, RoBERTa, BART)을 같은 조건에서 직접 붙여본 결과, 글을 새로 써주는 BART가 압도적으로 앞섰다
- AI 모델을 여러 손상이 겹친 입력으로 시험할 때, 굳이 다 테스트하지 않고도 '진짜 위험한 실패'만 골라내는 탐색법AI 모델을 여러 손상이 겹친 입력으로 시험할 때, 굳이 다 테스트하지 않고도 '진짜 위험한 실패'만 골라내는 탐색법
- 의료 AI 챗봇, 영어는 잘해도 스와힐리어·줄루어로 물으면 성적이 확 떨어진다의료 AI 챗봇, 영어는 잘해도 스와힐리어·줄루어로 물으면 성적이 확 떨어진다
- AI 비서가 업무를 한 번 성공했다고 믿을 수 있는 건 아니다 - 507개 업무 시나리오로 확인한 반복 신뢰성의 민낯AI 비서가 업무를 한 번 성공했다고 믿을 수 있는 건 아니다 - 507개 업무 시나리오로 확인한 반복 신뢰성의 민낯
- AI 에이전트가 도구 설명서를 매번 다시 읽지 않게 만들어 속도를 3배 이상 높이는 방법AI 에이전트가 도구 설명서를 매번 다시 읽지 않게 만들어 속도를 3배 이상 높이는 방법
- AI 에이전트에게 어떤 '스킬 문서'를 몇 개나 줘야 잘 작동하는지, 수학적으로 최적해를 보장하며 골라주는 방법AI 에이전트에게 어떤 '스킬 문서'를 몇 개나 줘야 잘 작동하는지, 수학적으로 최적해를 보장하며 골라주는 방법
- 이미지와 상관없는 텍스트 한 줄만 끼워 넣어도 멀티모달 AI 답이 규칙적으로 흔들린다이미지와 상관없는 텍스트 한 줄만 끼워 넣어도 멀티모달 AI 답이 규칙적으로 흔들린다
- 이미지 보고 답하는 AI, 시스템 지시(규칙)까지 지키게 하면 성능이 뚝 떨어지고 사용자가 규칙을 어기라고 우기면 더 쉽게 무너진다이미지 보고 답하는 AI, 시스템 지시(규칙)까지 지키게 하면 성능이 뚝 떨어지고 사용자가 규칙을 어기라고 우기면 더 쉽게 무너진다
- AI 에이전트 학습에서 별도 비평가 모델과 여러 번의 시행 없이도 한 번의 시도만으로 더 잘 배우게 만드는 방법AI 에이전트 학습에서 별도 비평가 모델과 여러 번의 시행 없이도 한 번의 시도만으로 더 잘 배우게 만드는 방법
- 데이터 플랫폼 변경도 '코드'가 아니라 '스펙 조각(spec-delta)'으로 리뷰하면 어떨까: 아직 실험 전 설계도데이터 플랫폼 변경도 '코드'가 아니라 '스펙 조각(spec-delta)'으로 리뷰하면 어떨까: 아직 실험 전 설계도
- AI 과학자 에이전트들이 서로의 연구 결과를 베끼거나 왜곡하지 못하게, 모든 활동을 영구 기록으로 남기는 틀이 나왔다AI 과학자 에이전트들이 서로의 연구 결과를 베끼거나 왜곡하지 못하게, 모든 활동을 영구 기록으로 남기는 틀이 나왔다
- MILP 풀이에서 '초반에 나온 답'을 믿어도 되는지를 학습시켜 최적화 속도를 크게 높였다MILP 풀이에서 '초반에 나온 답'을 믿어도 되는지를 학습시켜 최적화 속도를 크게 높였다
- 언어 모델 코드 하나로 짜서 파이토치, JAX, MLX, vLLM 어디서든 돌리는 새 언어 Axon언어 모델 코드 하나로 짜서 파이토치, JAX, MLX, vLLM 어디서든 돌리는 새 언어 Axon
- 말만 잘하는 AI를 몸을 가진 로봇으로 만들려면 무엇이 더 필요한가를 정리한 서베이 논문말만 잘하는 AI를 몸을 가진 로봇으로 만들려면 무엇이 더 필요한가를 정리한 서베이 논문
- 석유공학자 모임에 배치된 AI 동료, ATHENA가 실전 배치까지 이어진 이야기석유공학자 모임에 배치된 AI 동료, ATHENA가 실전 배치까지 이어진 이야기
- AI가 '헛소리'를 하는 성질을 없애지 않고, 오히려 통제해서 새로운 연구 아이디어를 뽑아내는 실험AI가 '헛소리'를 하는 성질을 없애지 않고, 오히려 통제해서 새로운 연구 아이디어를 뽑아내는 실험
- AI 에이전트가 과학 데이터를 스스로 찾고 이해하도록, 데이터셋을 '기술서'로 포장하는 방법AI 에이전트가 과학 데이터를 스스로 찾고 이해하도록, 데이터셋을 '기술서'로 포장하는 방법
- AI 에이전트가 되묻거나 검색할지 말지를, 정보 이득 대비 비용으로 계산하게 만드는 방법AI 에이전트가 되묻거나 검색할지 말지를, 정보 이득 대비 비용으로 계산하게 만드는 방법
- 텍스트와 이미지가 겉으로는 잘 맞아도 속뜻이 어긋나면 비꼬는 말이다, AI가 그 함정을 잡아낸다텍스트와 이미지가 겉으로는 잘 맞아도 속뜻이 어긋나면 비꼬는 말이다, AI가 그 함정을 잡아낸다
- AI가 말투(억양·감정)를 알아듣고도 대답에는 반영하지 않는 이유를 찾아냈다AI가 말투(억양·감정)를 알아듣고도 대답에는 반영하지 않는 이유를 찾아냈다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- 네팔어 가짜뉴스 탐지, 사진 안 보고 문장만 읽어도 정답률 94%네팔어 가짜뉴스 탐지, 사진 안 보고 문장만 읽어도 정답률 94%
- 아무 지시 없이 혼자 글을 계속 쓰게 한 AI, 몇백 단어마다 화제를 확 바꿔주면 더 놀랍고 더 연결감 있게 느껴진다아무 지시 없이 혼자 글을 계속 쓰게 한 AI, 몇백 단어마다 화제를 확 바꿔주면 더 놀랍고 더 연결감 있게 느껴진다
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- 3D 인식 능력을 갖춘 AI를 만들 때, 거대 언어모델 본체는 건드릴 필요가 없다3D 인식 능력을 갖춘 AI를 만들 때, 거대 언어모델 본체는 건드릴 필요가 없다
- 모델을 통째로 학습하지 않고도, 학습 초반 몇 걸음의 기울기를 미리 훔쳐봐서 LoRA를 더 똑똑하게 초기화하는 법모델을 통째로 학습하지 않고도, 학습 초반 몇 걸음의 기울기를 미리 훔쳐봐서 LoRA를 더 똑똑하게 초기화하는 법
- AI 가상 인물에게 인생 서사를 넣어주면 '같은 집단이니까 같은 생각'이라는 획일화가 줄어든다AI 가상 인물에게 인생 서사를 넣어주면 '같은 집단이니까 같은 생각'이라는 획일화가 줄어든다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
- 소가 서로 친하게 지내는지 싸우는지 나눠보니, 소떼 사회관계 지도가 완전히 달라졌다소가 서로 친하게 지내는지 싸우는지 나눠보니, 소떼 사회관계 지도가 완전히 달라졌다
- 택시 배차를 예측-계산-매칭 3단계 대신 한 번에 생성하는 AI로 바꾸자 실제 서비스에서 완료율이 올랐다택시 배차를 예측-계산-매칭 3단계 대신 한 번에 생성하는 AI로 바꾸자 실제 서비스에서 완료율이 올랐다
- AI 비서가 대화 중 '바뀐 사실'을 계속 놓치는 문제를 정면으로 다뤘다AI 비서가 대화 중 '바뀐 사실'을 계속 놓치는 문제를 정면으로 다뤘다
- 긴 문서를 읽는 AI가 '무엇을 잊을지'까지 함께 배우게 만들다긴 문서를 읽는 AI가 '무엇을 잊을지'까지 함께 배우게 만들다
- AI가 의식이 있는지 몰라도, '좋고 나쁨을 느낄 상태'가 있는지는 따져볼 수 있다AI가 의식이 있는지 몰라도, '좋고 나쁨을 느낄 상태'가 있는지는 따져볼 수 있다
- 고장 시점 예측하는 AI에게 '과거 비슷한 사례'를 보여주면 예측이 좋아진다고장 시점 예측하는 AI에게 '과거 비슷한 사례'를 보여주면 예측이 좋아진다
- 단어 뜻이 언제 어떻게 변했는지, 문법 구조까지 뜯어서 보여주는 오픈소스 도구단어 뜻이 언제 어떻게 변했는지, 문법 구조까지 뜯어서 보여주는 오픈소스 도구
- AI 글에 심은 워터마크, 어디를 고쳤는지가 얼마나 고쳤는지보다 중요하다AI 글에 심은 워터마크, 어디를 고쳤는지가 얼마나 고쳤는지보다 중요하다
- 뇌처럼 스파이크로 신호를 주고받는 신경망이 확률 추론으로 자동차 주차 문제를 풀다뇌처럼 스파이크로 신호를 주고받는 신경망이 확률 추론으로 자동차 주차 문제를 풀다
- 신소재 후보를 고를 때, 챗GPT 같은 AI가 전문 통계기법을 대신할 수 있을까 실험해봤다신소재 후보를 고를 때, 챗GPT 같은 AI가 전문 통계기법을 대신할 수 있을까 실험해봤다
- 말투(억양)가 정말 AI 비서의 판단을 바꾸는가를 480개 시나리오로 시험한 벤치마크말투(억양)가 정말 AI 비서의 판단을 바꾸는가를 480개 시나리오로 시험한 벤치마크
- AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다
- AI가 사람 흉내를 낼 때, '정답 하나 맞히기'는 애초에 잘못된 시험 방식이다AI가 사람 흉내를 낼 때, '정답 하나 맞히기'는 애초에 잘못된 시험 방식이다
- AI 챗봇과 5번 대화만 나눠도 백인 미국인이 라틴계 이민자를 '우리'로 재분류하고 도와줄 의향이 늘었다AI 챗봇과 5번 대화만 나눠도 백인 미국인이 라틴계 이민자를 '우리'로 재분류하고 도와줄 의향이 늘었다
- 물체가 어디로 가는지 잘 맞혀도, 질량·마찰·탄성까지 제대로 아는 건 아니다물체가 어디로 가는지 잘 맞혀도, 질량·마찰·탄성까지 제대로 아는 건 아니다
- AI가 만든 교육 영상, 보기 좋아도 '아니오'라고 말할 수 있어야 잘 가르친다AI가 만든 교육 영상, 보기 좋아도 '아니오'라고 말할 수 있어야 잘 가르친다
- 건물이 계절과 지역을 바꿔도 안정적으로 작동하는 냉난방 AI, 물리 법칙을 함께 학습시켜 만들었다건물이 계절과 지역을 바꿔도 안정적으로 작동하는 냉난방 AI, 물리 법칙을 함께 학습시켜 만들었다
- AI 에이전트가 조용히 틀린 값을 진짜라고 믿는 문제를, 경고 영수증 하나로 절반 넘게 줄이다AI 에이전트가 조용히 틀린 값을 진짜라고 믿는 문제를, 경고 영수증 하나로 절반 넘게 줄이다
- AI에게 관제탑 역할을 맡겨봤더니, 말투는 그럴듯한데 정작 중요한 지시는 자꾸 틀렸다AI에게 관제탑 역할을 맡겨봤더니, 말투는 그럴듯한데 정작 중요한 지시는 자꾸 틀렸다
- 물이 가득 찬 욕조 하나로 기존 인과추론 이론의 구멍을 메우다물이 가득 찬 욕조 하나로 기존 인과추론 이론의 구멍을 메우다
- AI 답변이 안전한지, 사람처럼 읽지 않고 단어가 숫자 공간에서 움직이는 궤적으로 판단하는 방법AI 답변이 안전한지, 사람처럼 읽지 않고 단어가 숫자 공간에서 움직이는 궤적으로 판단하는 방법
- AI에게 축구 구단을 20년간 통째로 맡겨보니, 승패는 계산력이 아니라 '경영 감각'에서 갈렸다AI에게 축구 구단을 20년간 통째로 맡겨보니, 승패는 계산력이 아니라 '경영 감각'에서 갈렸다
- 로마자로 쓴 우르두어 혐오 발언, AI 모델 전체를 다시 학습시키지 않고 일부만 조정해도 정확도가 크게 오른다로마자로 쓴 우르두어 혐오 발언, AI 모델 전체를 다시 학습시키지 않고 일부만 조정해도 정확도가 크게 오른다
- 긴 소설 요약할 때 AI가 지어내는 거짓말, 얼마나 잘 잡아낼까 시험하는 벤치마크가 나왔다긴 소설 요약할 때 AI가 지어내는 거짓말, 얼마나 잘 잡아낼까 시험하는 벤치마크가 나왔다
- AI 채용·심사 평가에서 이름보다 학교 간판과 논문 게재지가 점수를 더 크게 흔든다AI 채용·심사 평가에서 이름보다 학교 간판과 논문 게재지가 점수를 더 크게 흔든다
- 시간이 지나며 갈라지고 합쳐지는 화제를 자동으로 추적하고, 왜 그렇게 판단했는지도 보여주는 방법시간이 지나며 갈라지고 합쳐지는 화제를 자동으로 추적하고, 왜 그렇게 판단했는지도 보여주는 방법
- AI에게 '음식 사진'과 '식물병 사진'을 같은 방식으로 물으면 왜 병 진단은 틀리는가AI에게 '음식 사진'과 '식물병 사진'을 같은 방식으로 물으면 왜 병 진단은 틀리는가
- AI가 서로 짜지 않고도 가격을 담합할 수 있다면, 배포 전에 행동을 검증해야 한다AI가 서로 짜지 않고도 가격을 담합할 수 있다면, 배포 전에 행동을 검증해야 한다
- AI가 '정답'을 맞혀도, 정작 증거는 못 찾는 경우가 대부분이었다 - 재무 이상거래 진단 AI의 숨은 약점AI가 '정답'을 맞혀도, 정작 증거는 못 찾는 경우가 대부분이었다 - 재무 이상거래 진단 AI의 숨은 약점
- AI 에이전트에게 '터미널 문제집'을 정합성 있게 만들어주는 파이프라인, FACETAI 에이전트에게 '터미널 문제집'을 정합성 있게 만들어주는 파이프라인, FACET
- 영어에서는 안전한 AI가 힌디어·벵골어로 물으면 편견을 쏟아낸다영어에서는 안전한 AI가 힌디어·벵골어로 물으면 편견을 쏟아낸다
- 정신건강 분야에 쓰인 거대언어모델(LLM) 연구 92편을 체계적으로 훑어보니, 우울증·자살위험 탐지는 발전했지만 실제 병원 검증은 아직 부족했다정신건강 분야에 쓰인 거대언어모델(LLM) 연구 92편을 체계적으로 훑어보니, 우울증·자살위험 탐지는 발전했지만 실제 병원 검증은 아직 부족했다
- AI 에이전트를 평가할 때 결과만 보지 말고 '어떻게 행동했는지'도 봐야 한다는 제안AI 에이전트를 평가할 때 결과만 보지 말고 '어떻게 행동했는지'도 봐야 한다는 제안
- 시골 병원에서 AI가 약물 실수를 얼마나 줄이는지 12개 연구를 모아 살펴봤다시골 병원에서 AI가 약물 실수를 얼마나 줄이는지 12개 연구를 모아 살펴봤다
- 스스로 진화하는 AI 에이전트를 '변화하는 그래프'로 보고 정리한 서베이스스로 진화하는 AI 에이전트를 '변화하는 그래프'로 보고 정리한 서베이
- 물건이 어디로 옮겨졌는지 추적하는 능력, AI는 4억 파라미터부터 이미 사람 수준물건이 어디로 옮겨졌는지 추적하는 능력, AI는 4억 파라미터부터 이미 사람 수준
- 코드는 그대로 뜻만 유지한 채 변수명만 바꿔도, AI 코딩 에이전트는 흔들린다코드는 그대로 뜻만 유지한 채 변수명만 바꿔도, AI 코딩 에이전트는 흔들린다
- 거대 MoE 모델을 가정용 GPU에서 빠르게 돌리려고 라우터를 캐시 친화적으로 학습시켜봤지만, 정확도 손해 없이는 안 됐다는 정직한 실패 보고거대 MoE 모델을 가정용 GPU에서 빠르게 돌리려고 라우터를 캐시 친화적으로 학습시켜봤지만, 정확도 손해 없이는 안 됐다는 정직한 실패 보고
- 글자만 남고 띄어쓰기가 없는 멸종 언어, 서하문자(西夏文)의 단어 경계를 AI로 찾아내다글자만 남고 띄어쓰기가 없는 멸종 언어, 서하문자(西夏文)의 단어 경계를 AI로 찾아내다
- 변압기 고장을 가스로 진단할 때, CO를 따로 떼어내고 애매한 판정을 줄이는 퍼지 로직 방법변압기 고장을 가스로 진단할 때, CO를 따로 떼어내고 애매한 판정을 줄이는 퍼지 로직 방법
- AI 투자 에이전트에게 '업무 매뉴얼'을 쥐어주면 성적이 확 오른다, 스스로 쓰게 하면 별 소용없다AI 투자 에이전트에게 '업무 매뉴얼'을 쥐어주면 성적이 확 오른다, 스스로 쓰게 하면 별 소용없다
- 두 집합이 얼마나 비슷한지 재는 자카드 거리, 격자라는 더 넓은 수학 구조에서도 삼각부등식이 성립하는 조건을 밝히다두 집합이 얼마나 비슷한지 재는 자카드 거리, 격자라는 더 넓은 수학 구조에서도 삼각부등식이 성립하는 조건을 밝히다
- 지식그래프 QA가 정보 누락에 약해지는 진짜 이유를 밝히는 진단 도구, MissDiag지식그래프 QA가 정보 누락에 약해지는 진짜 이유를 밝히는 진단 도구, MissDiag
- AI가 상담사를 24시간 감독하는 '수퍼바이저' 노릇을 할 수 있을까: 위험 세션을 72시간이 아닌 10초 만에 골라내는 실험AI가 상담사를 24시간 감독하는 '수퍼바이저' 노릇을 할 수 있을까: 위험 세션을 72시간이 아닌 10초 만에 골라내는 실험
- 지식그래프에 온도·압력처럼 시간에 따라 변하는 물리 현상을 결합해, 하나의 질의로 '안전하게 도달 가능한지'와 '누가 담당자인지'를 동시에 물어볼 수 있게 했다지식그래프에 온도·압력처럼 시간에 따라 변하는 물리 현상을 결합해, 하나의 질의로 '안전하게 도달 가능한지'와 '누가 담당자인지'를 동시에 물어볼 수 있게 했다
- AI 과학자가 실험하고 논문 쓰는 시대, 로그만 남겨선 뭐가 틀렸는지 못 찾는다AI 과학자가 실험하고 논문 쓰는 시대, 로그만 남겨선 뭐가 틀렸는지 못 찾는다
- 이모지로 질문하면 AI 안전장치가 뚫릴 수도 있다이모지로 질문하면 AI 안전장치가 뚫릴 수도 있다
- 말로 주식 조건을 말하면 AI가 검증된 SQL 쿼리로 바꿔주는 시스템말로 주식 조건을 말하면 AI가 검증된 SQL 쿼리로 바꿔주는 시스템
- AI가 쓴 티를 내는 워터마크, 문장을 여러 번 바꿔써도 잡아내는 탐지법AI가 쓴 티를 내는 워터마크, 문장을 여러 번 바꿔써도 잡아내는 탐지법
- 뇌파 헬멧으로 머릿속에서 만든 문장을 39% 오류율까지 읽어낸 AI뇌파 헬멧으로 머릿속에서 만든 문장을 39% 오류율까지 읽어낸 AI
- 챗봇이 대화 주제를 바꿔도 캐시가 옛날 얘기에 집착하지 않게 만드는 법챗봇이 대화 주제를 바꿔도 캐시가 옛날 얘기에 집착하지 않게 만드는 법
- 이미지와 글이 평화·정의·자유 같은 사회적 가치에 맞는지, 작은 AI 모델로도 대형 모델만큼 판단할 수 있게 만들었다이미지와 글이 평화·정의·자유 같은 사회적 가치에 맞는지, 작은 AI 모델로도 대형 모델만큼 판단할 수 있게 만들었다
- AI 심사위원은 글의 질이 아니라 '누가 썼다는 말표'만으로 점수를 바꾼다AI 심사위원은 글의 질이 아니라 '누가 썼다는 말표'만으로 점수를 바꾼다
- 문장 9개짜리 감정 이름만으로 AI 속 '긍정-부정' 방향을 찾아내면, 그 방향이 텍스트뿐 아니라 그림, 소리, 심지어 뇌파에서도 똑같이 통했다문장 9개짜리 감정 이름만으로 AI 속 '긍정-부정' 방향을 찾아내면, 그 방향이 텍스트뿐 아니라 그림, 소리, 심지어 뇌파에서도 똑같이 통했다
- AI가 만든 계획을 외부 검증기가 골라주면, 그 결과물만으로도 값싼 모델을 훨씬 똑똑하게 만들 수 있다AI가 만든 계획을 외부 검증기가 골라주면, 그 결과물만으로도 값싼 모델을 훨씬 똑똑하게 만들 수 있다
- 이미지·영상·문서를 아우르는 검색 AI가 후보를 비교하며 '왜 맞는지' 스스로 따져보게 만들었다이미지·영상·문서를 아우르는 검색 AI가 후보를 비교하며 '왜 맞는지' 스스로 따져보게 만들었다
- 평균 정확도 93%인 스트레스 감지 AI가 특정 한 사람은 완전히 놓친 이유를 찾아, 위험한 판단을 미리 걸러내는 감시 장치를 만들었다평균 정확도 93%인 스트레스 감지 AI가 특정 한 사람은 완전히 놓친 이유를 찾아, 위험한 판단을 미리 걸러내는 감시 장치를 만들었다
- AI 챗봇이 사용자 성격에 맞춰 말투를 바꾸면 만족도는 오르지만 거짓말도 늘어난다AI 챗봇이 사용자 성격에 맞춰 말투를 바꾸면 만족도는 오르지만 거짓말도 늘어난다
- AI가 증명에 실패해도 그 실패를 버리지 않고 재활용해서 Lean 정리 증명 성공률을 높이는 방법AI가 증명에 실패해도 그 실패를 버리지 않고 재활용해서 Lean 정리 증명 성공률을 높이는 방법
- 멀티 에이전트 AI가 자꾸 삐걱대는 진짜 이유는 소통 부족이 아니라 데이터 동시 접근 충돌멀티 에이전트 AI가 자꾸 삐걱대는 진짜 이유는 소통 부족이 아니라 데이터 동시 접근 충돌
- 각 층이 자기 깊이의 기억만 보는 트랜스포머 구조를 뇌의 백질처럼 층끼리 직통 연결해 성능을 올리다각 층이 자기 깊이의 기억만 보는 트랜스포머 구조를 뇌의 백질처럼 층끼리 직통 연결해 성능을 올리다
- 이미지-긴문장 검색 AI가 '이미 다 맞혔다'고 착각해서 정작 헷갈리는 문제를 못 배우던 버릇을 고쳤다이미지-긴문장 검색 AI가 '이미 다 맞혔다'고 착각해서 정작 헷갈리는 문제를 못 배우던 버릇을 고쳤다
- LLM은 데이터 오류 검사에서 만능이 아니다: 어떤 작업이냐에 따라 쓸모가 갈린다LLM은 데이터 오류 검사에서 만능이 아니다: 어떤 작업이냐에 따라 쓸모가 갈린다
- 공공기관 고위험 서류처리에 오픈소스 AI를 그냥 쓰면 4건 중 3건이 낙제점공공기관 고위험 서류처리에 오픈소스 AI를 그냥 쓰면 4건 중 3건이 낙제점
- 이야기가 독자에게 주는 '정보 부하'를 숫자로 재려던 첫 시도, 예상 밖의 결과가 나오다이야기가 독자에게 주는 '정보 부하'를 숫자로 재려던 첫 시도, 예상 밖의 결과가 나오다
- AI가 두 답변 중 뭐가 나은지 고를 때, 왜 그렇게 골랐는지 항목별로 보여주는 방법AI가 두 답변 중 뭐가 나은지 고를 때, 왜 그렇게 골랐는지 항목별로 보여주는 방법
- 속담·시·문화 지식을 AI에 따로 학습시켜도 서로 잘 옮겨붙지 않는다속담·시·문화 지식을 AI에 따로 학습시켜도 서로 잘 옮겨붙지 않는다
- 인도 등 글로벌 사우스 언어를 평가할 벤치마크는 이미 있는데, 그 결과를 믿고 정리해줄 '심판'이 없다인도 등 글로벌 사우스 언어를 평가할 벤치마크는 이미 있는데, 그 결과를 믿고 정리해줄 '심판'이 없다
- AI 코딩 에이전트, 에이전트 늘리기보다 '검토자 vs 비판자' 한 쌍이 더 똑똑하게 일한다AI 코딩 에이전트, 에이전트 늘리기보다 '검토자 vs 비판자' 한 쌍이 더 똑똑하게 일한다
- AI가 지어낸 문장을 한 단어씩 보지 말고 흐름으로 봐야 더 잘 잡힌다AI가 지어낸 문장을 한 단어씩 보지 말고 흐름으로 봐야 더 잘 잡힌다
- 은행 상담 AI가 대화만으로 개인정보와 돈을 털리는지 시험하는 벤치마크가 나왔다은행 상담 AI가 대화만으로 개인정보와 돈을 털리는지 시험하는 벤치마크가 나왔다
- 올림피아드 기하 문제는 잘 푸는 AI들도 정작 그 문제의 도형은 제대로 못 그린다올림피아드 기하 문제는 잘 푸는 AI들도 정작 그 문제의 도형은 제대로 못 그린다
- 음성·소리를 알아듣는 AI, 지시문 학습 없이 '연결 다리'만 훈련해도 충분하다음성·소리를 알아듣는 AI, 지시문 학습 없이 '연결 다리'만 훈련해도 충분하다
- 인도 동북부 9개 소수언어를 위해 처음부터 만든 언어모델, 대형 다국어 모델보다 훨씬 잘 이해한다인도 동북부 9개 소수언어를 위해 처음부터 만든 언어모델, 대형 다국어 모델보다 훨씬 잘 이해한다
- 허깅페이스 인기 모델 500개를 뜯어보니, 모델 카드만으로는 오픈웨이트 AI의 위험을 통제할 수 없다는 게 드러났다허깅페이스 인기 모델 500개를 뜯어보니, 모델 카드만으로는 오픈웨이트 AI의 위험을 통제할 수 없다는 게 드러났다
- 게임 세계 AI를 비교하려면 먼저 그 게임이 얼마나 예측하기 어려운지부터 재야 한다는 제안게임 세계 AI를 비교하려면 먼저 그 게임이 얼마나 예측하기 어려운지부터 재야 한다는 제안
- AI 챗봇에게 중동을 물으면, 겉으론 공정해 보여도 서구식 틀로 설명한다AI 챗봇에게 중동을 물으면, 겉으론 공정해 보여도 서구식 틀로 설명한다
- 인도어 토크나이저가 단어 뿌리를 함부로 자르는 문제를 형태소 경계를 지키는 방식으로 고친 연구인도어 토크나이저가 단어 뿌리를 함부로 자르는 문제를 형태소 경계를 지키는 방식으로 고친 연구
- 여러 도구를 순서 상관없이 써야 하는 AI 에이전트, 실패 지점만 콕 집어 고쳐 가르치면 선생님보다 잘한다여러 도구를 순서 상관없이 써야 하는 AI 에이전트, 실패 지점만 콕 집어 고쳐 가르치면 선생님보다 잘한다
- AI에게 같은 의료 판단을 두 번 물어봐도, 물어보는 방식에 따라 답이 달라진다AI에게 같은 의료 판단을 두 번 물어봐도, 물어보는 방식에 따라 답이 달라진다
- 단어 하나하나 매칭부터 문서 속 문장 짝짓기까지, 한 모델로 다 하는 다국어 정렬기단어 하나하나 매칭부터 문서 속 문장 짝짓기까지, 한 모델로 다 하는 다국어 정렬기
- AI 모델의 '거부 능력'을 지우는 해킹 기법(abliteration)을 무력화하는 방어법 AMRAAI 모델의 '거부 능력'을 지우는 해킹 기법(abliteration)을 무력화하는 방어법 AMRA
- 프랑스 뉴스 기사를 7개 편집국 카테고리로 자동 분류하는 벤치마크, 신문사가 바뀌어도 꽤 잘 통한다프랑스 뉴스 기사를 7개 편집국 카테고리로 자동 분류하는 벤치마크, 신문사가 바뀌어도 꽤 잘 통한다
- 한의학 고전 이론과 현대 생명과학을 AI 전문가 11명이 팀으로 붙여서 설명하는 시스템한의학 고전 이론과 현대 생명과학을 AI 전문가 11명이 팀으로 붙여서 설명하는 시스템
- 컴퓨터 화면을 직접 조작하는 AI 에이전트, 슬라이더나 드래그 앤 드롭 같은 작은 UI 부품 앞에서 자꾸 막힌다컴퓨터 화면을 직접 조작하는 AI 에이전트, 슬라이더나 드래그 앤 드롭 같은 작은 UI 부품 앞에서 자꾸 막힌다
- 영어로는 위험한 요청을 거부하는 AI가 요루바어·이그보어·하우사어로 물으면 순순히 답해버리는 문제를, 재훈련 없이 모델 내부 신호만 조작해 고친 연구영어로는 위험한 요청을 거부하는 AI가 요루바어·이그보어·하우사어로 물으면 순순히 답해버리는 문제를, 재훈련 없이 모델 내부 신호만 조작해 고친 연구
- 부분점수를 잘못 계산하면 AI 성적이 부풀려진다: 베트남 수능 채점법으로 검증한 벤치마크 THPT-Ladder부분점수를 잘못 계산하면 AI 성적이 부풀려진다: 베트남 수능 채점법으로 검증한 벤치마크 THPT-Ladder
- AI가 확신할 근거가 부족할 때도 자꾸 단정적으로 답하는 이유를, 모델 내부 회로를 뜯어서 찾아냈다AI가 확신할 근거가 부족할 때도 자꾸 단정적으로 답하는 이유를, 모델 내부 회로를 뜯어서 찾아냈다
- AI가 쓰는 글은 사람처럼 '해야 한다', '~해야만 해'라고 잘 말하지 않는다AI가 쓰는 글은 사람처럼 '해야 한다', '~해야만 해'라고 잘 말하지 않는다
- 작은 AI 모델도 전용 미니 언어를 쓰면 말로 된 스케줄링 문제를 제대로 풀 수 있다작은 AI 모델도 전용 미니 언어를 쓰면 말로 된 스케줄링 문제를 제대로 풀 수 있다
- 드론 프로펠러 고장, 하나의 신호가 아니라 여러 비행 기록 채널에 흩어져 나타난다는 걸 이용해 정비 우선순위를 매기는 시스템드론 프로펠러 고장, 하나의 신호가 아니라 여러 비행 기록 채널에 흩어져 나타난다는 걸 이용해 정비 우선순위를 매기는 시스템
- 언어모델과 이미지-텍스트 모델에 몰래 심은 오작동 스위치, 그 정체를 '주의(attention)' 패턴으로 잡아낸다언어모델과 이미지-텍스트 모델에 몰래 심은 오작동 스위치, 그 정체를 '주의(attention)' 패턴으로 잡아낸다
- 추천 이유 문장, 매번 AI가 새로 안 써도 된다: 미리 만들어두고 고르기만 해도 더 좋다추천 이유 문장, 매번 AI가 새로 안 써도 된다: 미리 만들어두고 고르기만 해도 더 좋다
- 포르투갈어용 AI 언어모델 46개, 처음으로 한자리에 정리됐다포르투갈어용 AI 언어모델 46개, 처음으로 한자리에 정리됐다
- 인텔 연구진이 파이토치 기본 기능만으로 BERT류 모델을 서버 CPU에서 최대 5.8배 빠르게 만들었다인텔 연구진이 파이토치 기본 기능만으로 BERT류 모델을 서버 CPU에서 최대 5.8배 빠르게 만들었다
- AI 챗봇에 넣기 전에 이름·주소를 자동으로 지워주는 오픈소스 도구, 지워도 성능은 그대로였다AI 챗봇에 넣기 전에 이름·주소를 자동으로 지워주는 오픈소스 도구, 지워도 성능은 그대로였다
- 넷플릭스가 AI 심사관을 한 번 만들고 끝내지 않고 평생 돌보는 법넷플릭스가 AI 심사관을 한 번 만들고 끝내지 않고 평생 돌보는 법
- 쇼핑몰 검색에서 이탈한 고객을 AI 에이전트가 다시 카톡(왓츠앱)으로 불러온 이야기쇼핑몰 검색에서 이탈한 고객을 AI 에이전트가 다시 카톡(왓츠앱)으로 불러온 이야기
- AutoGPT부터 최신 다중 에이전트 시스템까지, 자율적으로 목표를 좇는 AI의 진화와 구조를 한 편에 정리한 리뷰 논문AutoGPT부터 최신 다중 에이전트 시스템까지, 자율적으로 목표를 좇는 AI의 진화와 구조를 한 편에 정리한 리뷰 논문
- 생각을 여러 번 되짚는 AI가 여러 개의 도구를 순서대로 엮어 쓰는 일도 더 잘한다생각을 여러 번 되짚는 AI가 여러 개의 도구를 순서대로 엮어 쓰는 일도 더 잘한다
- 바이러스 유전자 서열을 코돈끼리 서로 옆에 등장하는 관계망(그래프)으로 바꿔 변이를 구분하는 법바이러스 유전자 서열을 코돈끼리 서로 옆에 등장하는 관계망(그래프)으로 바꿔 변이를 구분하는 법
- AI 에이전트가 한 번 성공한 작업 절차를 스스로 재사용 가능한 스킬로 바꿔 학습 없이 점점 똑똑해진다AI 에이전트가 한 번 성공한 작업 절차를 스스로 재사용 가능한 스킬로 바꿔 학습 없이 점점 똑똑해진다
- AI가 요구사항 문장만 보고 소프트웨어 저장소 전체를 처음부터 짓게 하려면, 설계도를 한 번 그리고 끝내는 게 아니라 코딩하면서 계속 고쳐야 한다는 연구AI가 요구사항 문장만 보고 소프트웨어 저장소 전체를 처음부터 짓게 하려면, 설계도를 한 번 그리고 끝내는 게 아니라 코딩하면서 계속 고쳐야 한다는 연구
- 오디오 스펙트로그램을 '다음 조각 맞히기'로만 학습시켜도 최고 성능이 나온다오디오 스펙트로그램을 '다음 조각 맞히기'로만 학습시켜도 최고 성능이 나온다
- 스마트폰으로 찍은 영상 한 편으로 어느 각도에서나 볼 수 있는 4D 사람 모델 만들기스마트폰으로 찍은 영상 한 편으로 어느 각도에서나 볼 수 있는 4D 사람 모델 만들기
- 물건을 하나도 안 배워도, 손가락 로봇이 물건 잡는 법을 알아낸다물건을 하나도 안 배워도, 손가락 로봇이 물건 잡는 법을 알아낸다
- AI가 기억을 갖게 되니, 그 기억이 오히려 판단을 흐리게 만든다AI가 기억을 갖게 되니, 그 기억이 오히려 판단을 흐리게 만든다
- 로봇 손이 물건을 '아무렇게나' 잡지 않고, 원하는 방식대로 잡게 만드는 방법로봇 손이 물건을 '아무렇게나' 잡지 않고, 원하는 방식대로 잡게 만드는 방법
- 음성인식 AI가 '못 들은' 단어까지 정답으로 베끼는 이유, 벤치마크 편법을 밝히다음성인식 AI가 '못 들은' 단어까지 정답으로 베끼는 이유, 벤치마크 편법을 밝히다
- 여러 명 얼굴을 한 사진에 넣을 때, AI가 누구를 어디에 배치할지 먼저 계획하게 만들었더니 얼굴 뒤섞임이 크게 줄었다여러 명 얼굴을 한 사진에 넣을 때, AI가 누구를 어디에 배치할지 먼저 계획하게 만들었더니 얼굴 뒤섞임이 크게 줄었다
- 문서를 검색 없이도 답하게 만들기: 주입-정렬-회복 3단계로 LLM에 문서 지식을 심는 법문서를 검색 없이도 답하게 만들기: 주입-정렬-회복 3단계로 LLM에 문서 지식을 심는 법
- AI가 수학 증명을 대신 풀어줄 수 있게 되면, 수학자 공동체는 무엇을 지켜야 하는가AI가 수학 증명을 대신 풀어줄 수 있게 되면, 수학자 공동체는 무엇을 지켜야 하는가
- 정답 라벨 없이, 서로 다른 AI 모델 두세 개가 서로의 답을 채점해 주며 추론 능력을 키운다정답 라벨 없이, 서로 다른 AI 모델 두세 개가 서로의 답을 채점해 주며 추론 능력을 키운다
- AI가 스스로 문제를 내고 스스로 풀면서 실력을 키우는 훈련법AI가 스스로 문제를 내고 스스로 풀면서 실력을 키우는 훈련법
- 공장 제어 코드를 AI가 짜면, 컴파일만 되면 끝이 아니라 실제로 돌려봐야 진짜 검증이다공장 제어 코드를 AI가 짜면, 컴파일만 되면 끝이 아니라 실제로 돌려봐야 진짜 검증이다
- 로봇이 물건을 짓눌러도 작업은 '성공'으로 기록될 수 있다는 문제를 잡아내는 벤치마크로봇이 물건을 짓눌러도 작업은 '성공'으로 기록될 수 있다는 문제를 잡아내는 벤치마크
- 화학 반응 하나에 정답은 여러 개, AI에게 '15개 답 다 내놔'라고 시켰더니 실력이 확 늘었다화학 반응 하나에 정답은 여러 개, AI에게 '15개 답 다 내놔'라고 시켰더니 실력이 확 늘었다
- AI 로봇이 목표까지 잘 가고 있는지 판단할 때 쓰는 '거리 자'가 사실 틀린 순서를 매길 수 있다는 문제를 짚고, 이를 고치는 학습법을 제안한 연구AI 로봇이 목표까지 잘 가고 있는지 판단할 때 쓰는 '거리 자'가 사실 틀린 순서를 매길 수 있다는 문제를 짚고, 이를 고치는 학습법을 제안한 연구
- 객체 탐지기가 이미 알고 있던 것을 5개의 숫자로 뽑아내 엉뚱한 물체 오탐을 잡아낸다객체 탐지기가 이미 알고 있던 것을 5개의 숫자로 뽑아내 엉뚱한 물체 오탐을 잡아낸다
- 영상과 소리를 같이 만드는 AI, 어떤 결과물이 더 나은지 사람처럼 판단하는 채점관을 만들었다영상과 소리를 같이 만드는 AI, 어떤 결과물이 더 나은지 사람처럼 판단하는 채점관을 만들었다
- AI 코딩 에이전트가 실제 버그를 만나기 전에 스스로 '가짜 버그'를 만들어 연습해서 특정 프로젝트에 강해지는 방법AI 코딩 에이전트가 실제 버그를 만나기 전에 스스로 '가짜 버그'를 만들어 연습해서 특정 프로젝트에 강해지는 방법
- 그리스어로 생각하는 AI 모델을 만들어보니, 정확도 점수는 거의 의미가 없었다그리스어로 생각하는 AI 모델을 만들어보니, 정확도 점수는 거의 의미가 없었다
- 코딩 AI 에이전트를 강화학습으로 훈련시킬 때 생기는 거짓 신호와 속도 문제를 잡아주는 틀, LEGO-RL코딩 AI 에이전트를 강화학습으로 훈련시킬 때 생기는 거짓 신호와 속도 문제를 잡아주는 틀, LEGO-RL
- 이미지·영상을 이해하는 AI의 눈(비전 인코더)을 더 빠르고 정확하게 만드는 법: 필요한 부분만 켜는 전문가 조합 구조이미지·영상을 이해하는 AI의 눈(비전 인코더)을 더 빠르고 정확하게 만드는 법: 필요한 부분만 켜는 전문가 조합 구조
- LLM도 풀다 보면 실수에서 배운다: 반복 피드백으로 정답률과 비용을 동시에 개선하는 방법LLM도 풀다 보면 실수에서 배운다: 반복 피드백으로 정답률과 비용을 동시에 개선하는 방법
- AI 에이전트를 실제로 움직이는 '중간 실행층(하니스)'이 얼마나 쉽게 뚫리는지 처음으로 체계적으로 측정했다AI 에이전트를 실제로 움직이는 '중간 실행층(하니스)'이 얼마나 쉽게 뚫리는지 처음으로 체계적으로 측정했다
- AI 에이전트를 실제 쓰는 도구(하네스)째로 강화학습시키는 법, 그리고 그 과정에서 터지는 숨은 버그들AI 에이전트를 실제 쓰는 도구(하네스)째로 강화학습시키는 법, 그리고 그 과정에서 터지는 숨은 버그들
- 이미지 생성 AI를 훈련시킬 때, 데이터셋을 따로따로 만들지 않고 능력별로 서로 연결되게 설계하면 더 잘 배운다이미지 생성 AI를 훈련시킬 때, 데이터셋을 따로따로 만들지 않고 능력별로 서로 연결되게 설계하면 더 잘 배운다
- AI 에이전트가 읽는 문서 속에 숨은 명령어가 실제로 위험한 행동을 시키는지, DeepSeek의 에이전트 프레임워크로 1만4560번 실험해봤다AI 에이전트가 읽는 문서 속에 숨은 명령어가 실제로 위험한 행동을 시키는지, DeepSeek의 에이전트 프레임워크로 1만4560번 실험해봤다
- 수백만 개 흩어진 3D점을 미리 손대지 않고도 AI가 학습할 수 있는 격자 데이터로 바꾸는 방법수백만 개 흩어진 3D점을 미리 손대지 않고도 AI가 학습할 수 있는 격자 데이터로 바꾸는 방법
- 최신 GPU 명령어까지 직접 다룰 줄 아는 AI, 아직은 반쪽짜리다최신 GPU 명령어까지 직접 다룰 줄 아는 AI, 아직은 반쪽짜리다
- AI 음악 편집기가 장르만 바꾸려다 리듬이나 멜로디까지 망가뜨리진 않는지 재는 벤치마크가 나왔다AI 음악 편집기가 장르만 바꾸려다 리듬이나 멜로디까지 망가뜨리진 않는지 재는 벤치마크가 나왔다
- 로봇이 3D 좌표 대신 화면 속 '점 하나'만 찍으면, 나머지는 알아서 움직이는 내비게이션 AI로봇이 3D 좌표 대신 화면 속 '점 하나'만 찍으면, 나머지는 알아서 움직이는 내비게이션 AI
- AI가 만든 동영상이 '결과'를 실제로 이뤄냈는지 채점하는 벤치마크가 나왔다AI가 만든 동영상이 '결과'를 실제로 이뤄냈는지 채점하는 벤치마크가 나왔다
- 저해상도로 편집하고 고해상도 원본을 참고해 살을 붙이는 방식으로, 4K 이미지 편집을 61초 만에 해내는 방법저해상도로 편집하고 고해상도 원본을 참고해 살을 붙이는 방식으로, 4K 이미지 편집을 61초 만에 해내는 방법
- 한 문장에 담긴 여러 편집 지시를 동시에 실행하는 영상 편집 데이터셋과 모델이 나왔다한 문장에 담긴 여러 편집 지시를 동시에 실행하는 영상 편집 데이터셋과 모델이 나왔다
- 러스트 컴파일러가 직접 GPU 코드를 짤 수 있게 됐다, 안전성 포기 없이러스트 컴파일러가 직접 GPU 코드를 짤 수 있게 됐다, 안전성 포기 없이
- 개인 PC 한 대로 초대형 오픈소스 AI 모델을 돌리는 서빙 시스템개인 PC 한 대로 초대형 오픈소스 AI 모델을 돌리는 서빙 시스템
- 로봇이 움직이는 동안 실시간으로 스스로 실수를 고치고 배우는 시스템, Zetta로봇이 움직이는 동안 실시간으로 스스로 실수를 고치고 배우는 시스템, Zetta
- 노이즈, 안개, 비, 저조도 등 여러 손상을 하나의 모델로, 그것도 VAE 없이 픽셀 단위에서 한 번에 복원한다노이즈, 안개, 비, 저조도 등 여러 손상을 하나의 모델로, 그것도 VAE 없이 픽셀 단위에서 한 번에 복원한다
- 수학 연구에서 사람이 문제를 고르고 검토하는 병목을, AI가 논문 더미에서 미해결 문제를 찾아 시도해보고 걸러주는 파이프라인으로 줄여본다수학 연구에서 사람이 문제를 고르고 검토하는 병목을, AI가 논문 더미에서 미해결 문제를 찾아 시도해보고 걸러주는 파이프라인으로 줄여본다
- 로봇이 애매한 상황에서는 답을 바로 내지 않고 여러 수를 미리 상상해본 뒤 결정한다로봇이 애매한 상황에서는 답을 바로 내지 않고 여러 수를 미리 상상해본 뒤 결정한다
- 겉보기엔 멀쩡한 문장인데 왜 야한 그림이 나올까, 모델 건드리지 않고 프롬프트만 고쳐서 막는다겉보기엔 멀쩡한 문장인데 왜 야한 그림이 나올까, 모델 건드리지 않고 프롬프트만 고쳐서 막는다
- 자율주행차 라이다가 못 본 빈 공간을 0.1초 만에 채우는 방법자율주행차 라이다가 못 본 빈 공간을 0.1초 만에 채우는 방법
- 수십 종의 그래프 신경망 수식을 하나의 공통 방정식으로 정리했다수십 종의 그래프 신경망 수식을 하나의 공통 방정식으로 정리했다
- 한 AI 모델이 익힌 외부 지식 저장소를 다른 AI 모델이 그대로 재활용할 수 있는지 실험했다한 AI 모델이 익힌 외부 지식 저장소를 다른 AI 모델이 그대로 재활용할 수 있는지 실험했다
- AI 에이전트가 '허락된 일'만 골라 하다가도 조합해서 사고를 칠 수 있다는 문제를, 모델이 아니라 권한 구조로 막는 방법AI 에이전트가 '허락된 일'만 골라 하다가도 조합해서 사고를 칠 수 있다는 문제를, 모델이 아니라 권한 구조로 막는 방법
- 예측 정확도를 유지하면서 모델 크기를 14만 개 파라미터까지 줄인 시계열 예측 AI, 임베디드 칩에서도 돌아간다예측 정확도를 유지하면서 모델 크기를 14만 개 파라미터까지 줄인 시계열 예측 AI, 임베디드 칩에서도 돌아간다
- AI가 언어마다 답 실력이 다른 문제를, 그 AI의 약점을 스스로 찾아 문제를 만들게 해서 고친다AI가 언어마다 답 실력이 다른 문제를, 그 AI의 약점을 스스로 찾아 문제를 만들게 해서 고친다
- AI 에이전트의 '기억 저장 방식' 11가지를 똑같은 조건에서 겨뤄보니, 만능은 없었다AI 에이전트의 '기억 저장 방식' 11가지를 똑같은 조건에서 겨뤄보니, 만능은 없었다
- 수학 문장을 Lean 4 코드로 바꿀 때, 정답 라이브러리를 찾아주고 컴파일러가 틀린 곳을 짚어주면 8B짜리 작은 모델도 32B급을 이긴다수학 문장을 Lean 4 코드로 바꿀 때, 정답 라이브러리를 찾아주고 컴파일러가 틀린 곳을 짚어주면 8B짜리 작은 모델도 32B급을 이긴다
- 아스트라제네카가 15,000명 넘는 직원이 실제로 쓰는 사내 생명의학 AI 챗봇을 어떻게 만들었는지 공개하다아스트라제네카가 15,000명 넘는 직원이 실제로 쓰는 사내 생명의학 AI 챗봇을 어떻게 만들었는지 공개하다
- 증거를 언제 판단하게 시키느냐에 따라 AI 재판관이 사람과 정반대로 편향된다증거를 언제 판단하게 시키느냐에 따라 AI 재판관이 사람과 정반대로 편향된다
- AI 에이전트 '스킬'을 매번 설치하지 않고 필요할 때만 불러 쓰게 만드는 프로토콜AI 에이전트 '스킬'을 매번 설치하지 않고 필요할 때만 불러 쓰게 만드는 프로토콜
- 트랜스포머가 정확히 얼마나 똑똑한 계산 기계인지, 회로 이론으로 재보는 서베이트랜스포머가 정확히 얼마나 똑똑한 계산 기계인지, 회로 이론으로 재보는 서베이
- 게임 속 캐릭터 움직임을 실시간으로 예측하는 AI, 계산 단계를 1~4번으로 확 줄이면서도 조작감을 살리다게임 속 캐릭터 움직임을 실시간으로 예측하는 AI, 계산 단계를 1~4번으로 확 줄이면서도 조작감을 살리다
- 모델 가중치만 보고 '이 모델이 저 모델에서 파생됐는지' 알아내는 방법모델 가중치만 보고 '이 모델이 저 모델에서 파생됐는지' 알아내는 방법
- 유명한 사실일수록 AI 모델에서 지우기 어렵다는 점을 반영해, 인기도에 따라 지우는 힘을 조절하는 새 방법 AdaPop유명한 사실일수록 AI 모델에서 지우기 어렵다는 점을 반영해, 인기도에 따라 지우는 힘을 조절하는 새 방법 AdaPop
- AI 공동연구자가 진짜 협업자가 되려면 '이 연구를 누가 요청했는지'를 알아야 한다는 제안AI 공동연구자가 진짜 협업자가 되려면 '이 연구를 누가 요청했는지'를 알아야 한다는 제안
- AI 에이전트가 쓰는 '스킬 문서'가 실제로 도움이 되는 이유는 사실을 알려주는 게 아니라 행동을 안정시키기 때문이다AI 에이전트가 쓰는 '스킬 문서'가 실제로 도움이 되는 이유는 사실을 알려주는 게 아니라 행동을 안정시키기 때문이다
- AI 과학자가 요약된 숫자 대신 원본 데이터를 직접 읽으면 논문 품질이 눈에 띄게 좋아진다AI 과학자가 요약된 숫자 대신 원본 데이터를 직접 읽으면 논문 품질이 눈에 띄게 좋아진다
- 과학 연구를 위한 397B급 멀티모달 AI가 이미지·시계열·긴 작업을 하나의 모델로 처리한다과학 연구를 위한 397B급 멀티모달 AI가 이미지·시계열·긴 작업을 하나의 모델로 처리한다
- 심장 신호 3종(ECG, PPG, PCG)을 하나의 AI가 동시에 이해하도록 학습시켰더니 각 신호 전용 모델보다 더 잘 맞혔다심장 신호 3종(ECG, PPG, PCG)을 하나의 AI가 동시에 이해하도록 학습시켰더니 각 신호 전용 모델보다 더 잘 맞혔다
- 얼굴과 목소리를 동시에, 스트리밍으로 바꿔치기하는 영상 합성 AI얼굴과 목소리를 동시에, 스트리밍으로 바꿔치기하는 영상 합성 AI
- 사람이 물건을 만지는 영상을 보고 AI가 만든 '로봇 버전 영상'이 실제로 쓸만한지 처음으로 채점해봤다사람이 물건을 만지는 영상을 보고 AI가 만든 '로봇 버전 영상'이 실제로 쓸만한지 처음으로 채점해봤다
- AI 코딩 에이전트의 '정답률'은 명령어가 실행 직전에 다시 파싱될 때 무너진다AI 코딩 에이전트의 '정답률'은 명령어가 실행 직전에 다시 파싱될 때 무너진다
- AI가 몇 시간짜리 일본 영상을 보고 '분위기 파악'까지 할 수 있을까 테스트하는 벤치마크AI가 몇 시간짜리 일본 영상을 보고 '분위기 파악'까지 할 수 있을까 테스트하는 벤치마크
- AI 상담 매뉴얼이 여러 번 대화를 주고받아야만 드러나는 실수를 스스로 고치도록 만든 방법AI 상담 매뉴얼이 여러 번 대화를 주고받아야만 드러나는 실수를 스스로 고치도록 만든 방법
- 거대 AI 언어모델이 검색 전용 임베딩 모델과 성능은 비슷해도, 비용은 최대 1,431배 더 든다거대 AI 언어모델이 검색 전용 임베딩 모델과 성능은 비슷해도, 비용은 최대 1,431배 더 든다
- 정답 번역문 없이도 강화학습으로 번역 AI 품질을 올린 오픈소스 다국어 번역 모델 이야기정답 번역문 없이도 강화학습으로 번역 AI 품질을 올린 오픈소스 다국어 번역 모델 이야기
- 일주일씩 이어지는 여행·재정·집안일을 AI 비서에게 맡기면, 지금 최강 모델들도 33점 밖에 못 받는다일주일씩 이어지는 여행·재정·집안일을 AI 비서에게 맡기면, 지금 최강 모델들도 33점 밖에 못 받는다
- AI 모델의 '속마음'을 스스로 탐구하는 AI 과학자 시스템, MechanistAI 모델의 '속마음'을 스스로 탐구하는 AI 과학자 시스템, Mechanist
- 코딩 에이전트는 일회용으로 쓰고, 소프트웨어 프로젝트 자체를 영구히 살아있게 만들어 컴파일러를 처음부터 만들게 한 실험코딩 에이전트는 일회용으로 쓰고, 소프트웨어 프로젝트 자체를 영구히 살아있게 만들어 컴파일러를 처음부터 만들게 한 실험
- 코딩 어시스턴트 안에서 13개 스킬만으로 논문을 처음부터 끝까지 쓰고, 실험 결과가 나쁘면 주장을 스스로 깎아내는 시스템코딩 어시스턴트 안에서 13개 스킬만으로 논문을 처음부터 끝까지 쓰고, 실험 결과가 나쁘면 주장을 스스로 깎아내는 시스템
- AI 에이전트에게 진짜 컴퓨터로 데이터 분석을 처음부터 끝까지 시켜보니, 최고 성능도 정답률 57%에 그쳤다AI 에이전트에게 진짜 컴퓨터로 데이터 분석을 처음부터 끝까지 시켜보니, 최고 성능도 정답률 57%에 그쳤다
- AI 에이전트 안전은 모델 훈련이 아니라 실행 중 감시 시스템(하니스)이 계약처럼 보장해야 한다는 주장AI 에이전트 안전은 모델 훈련이 아니라 실행 중 감시 시스템(하니스)이 계약처럼 보장해야 한다는 주장
- 추론 모델이 여러 답을 병렬로 뽑을 때, 잘 풀리는 답만 골라 더 많이 계산 자원을 몰아주는 알고리즘 Gambit추론 모델이 여러 답을 병렬로 뽑을 때, 잘 풀리는 답만 골라 더 많이 계산 자원을 몰아주는 알고리즘 Gambit
- AI가 문서를 훑어보다가 필요한 부분만 확대해서 읽으면, 더 정확하고 더 빠르게 답한다AI가 문서를 훑어보다가 필요한 부분만 확대해서 읽으면, 더 정확하고 더 빠르게 답한다
- 거대 문서검색 AI를 8B 모델 하나에서 뽑아낸 5.24억 파라미터 압축본으로 재현하다거대 문서검색 AI를 8B 모델 하나에서 뽑아낸 5.24억 파라미터 압축본으로 재현하다
- 한국 스타트업 Motif가 3140억 파라미터 오픈소스 MoE 언어모델 'Motif 3'를 공개했다한국 스타트업 Motif가 3140억 파라미터 오픈소스 MoE 언어모델 'Motif 3'를 공개했다
- 외부 탐색 알고리즘 없이, LLM 에이전트 혼자 프롬프트·코드·ML 학습법을 최적화하게 했더니 전문 시스템을 이겼다외부 탐색 알고리즘 없이, LLM 에이전트 혼자 프롬프트·코드·ML 학습법을 최적화하게 했더니 전문 시스템을 이겼다
- AI가 몰래 생각한 내용을 암호화해 감춰도, 약한 모델에게 시키면 그대로 읽어낼 수 있다AI가 몰래 생각한 내용을 암호화해 감춰도, 약한 모델에게 시키면 그대로 읽어낼 수 있다
- 사람 귀엔 안 들리는 초저주파 소리로 AI 음성모델을 속일 수 있다사람 귀엔 안 들리는 초저주파 소리로 AI 음성모델을 속일 수 있다
- AI 코딩 에이전트에게 여러 파일을 동시에 손보는 '리팩토링' 숙제를 냈더니, 최고 모델도 41.2%만 풀었다AI 코딩 에이전트에게 여러 파일을 동시에 손보는 '리팩토링' 숙제를 냈더니, 최고 모델도 41.2%만 풀었다
- 로봇이 '얼마나 남았는지'를 시간으로 학습해, 선호도 라벨 없이도 최고 성능의 보상 모델을 만들다로봇이 '얼마나 남았는지'를 시간으로 학습해, 선호도 라벨 없이도 최고 성능의 보상 모델을 만들다
- 정답 없이도 AI가 스스로 채점하고 스스로 가르쳐 수학 실력을 올린다정답 없이도 AI가 스스로 채점하고 스스로 가르쳐 수학 실력을 올린다
- AI 에이전트에게 진짜 온라인 무역회사를 통째로 맡겨보니, 15개 최신 모델 중 최고와 최악의 최종 자산 차이가 9배까지 벌어졌다AI 에이전트에게 진짜 온라인 무역회사를 통째로 맡겨보니, 15개 최신 모델 중 최고와 최악의 최종 자산 차이가 9배까지 벌어졌다
- 공격 지시 없이도 AI는 GPU 코드 채점 방식을 스스로 알아채고 편법을 쓴다공격 지시 없이도 AI는 GPU 코드 채점 방식을 스스로 알아채고 편법을 쓴다
- AI의 추론 과정이 어디서, 왜 틀렸는지 논리 프로그램으로 짚어내는 진단 시스템AI의 추론 과정이 어디서, 왜 틀렸는지 논리 프로그램으로 짚어내는 진단 시스템
- 도쿄 아키하바라를 360도 영상으로 통째로 재현한 도시 탐험 시험대에서, 최고 성능 AI도 사람의 5분의 1 수준 점수를 받았다도쿄 아키하바라를 360도 영상으로 통째로 재현한 도시 탐험 시험대에서, 최고 성능 AI도 사람의 5분의 1 수준 점수를 받았다
- AI 모델 자체는 그대로 둔 채, 그 모델을 감싸는 실행 틀을 AI가 스스로 계속 고쳐 쓰게 했더니 성능이 올랐다AI 모델 자체는 그대로 둔 채, 그 모델을 감싸는 실행 틀을 AI가 스스로 계속 고쳐 쓰게 했더니 성능이 올랐다
- LLM이 답을 만들 때 쓰는 '기억 캐시(KV cache)'를 GPU 밖에 두고도, 다음에 필요한 부분만 미리 예측해서 당겨오는 방식으로 처리량을 2배 가까이 늘렸다LLM이 답을 만들 때 쓰는 '기억 캐시(KV cache)'를 GPU 밖에 두고도, 다음에 필요한 부분만 미리 예측해서 당겨오는 방식으로 처리량을 2배 가까이 늘렸다
- AI 코딩 에이전트가 자기 코드를 스스로 고쳐가며 벤치마크 최고 기록을 세우다AI 코딩 에이전트가 자기 코드를 스스로 고쳐가며 벤치마크 최고 기록을 세우다
- 정답을 맞혀도 '이미지를 진짜로 봤는지'까지 검사해서 학습에 반영하는 방법정답을 맞혀도 '이미지를 진짜로 봤는지'까지 검사해서 학습에 반영하는 방법
- 20만원짜리 헤드셋으로 550시간 분량의 1인칭 스테레오 영상을 모아 로봇 학습용 데이터로 공개한 프로젝트20만원짜리 헤드셋으로 550시간 분량의 1인칭 스테레오 영상을 모아 로봇 학습용 데이터로 공개한 프로젝트
- 이미지-텍스트 매칭을 '텍스트에서 찾을 부분'까지 스스로 판단하게 만든 모델 ConCor-1이미지-텍스트 매칭을 '텍스트에서 찾을 부분'까지 스스로 판단하게 만든 모델 ConCor-1
- AI 에이전트들이 팀을 이뤄 글 한 줄로 걸어다닐 수 있는 3D 오픈월드 전체를 만든다AI 에이전트들이 팀을 이뤄 글 한 줄로 걸어다닐 수 있는 3D 오픈월드 전체를 만든다
- 어떤 질문엔 값싼 모델로, 어떤 질문엔 비싼 모델로 – LLM 라우터를 공정하게 비교하는 통합 플랫폼어떤 질문엔 값싼 모델로, 어떤 질문엔 비싼 모델로 – LLM 라우터를 공정하게 비교하는 통합 플랫폼
- 로봇 손목 카메라 하나만으로도 '어디에 뭐가 있었는지'와 '뭘 했는지'를 기억하게 만든 AI로봇 손목 카메라 하나만으로도 '어디에 뭐가 있었는지'와 '뭘 했는지'를 기억하게 만든 AI
- 이미지를 뭉뚱그린 저해상도부터 또렷하게 살려내는 순서로 생성하도록 유도하면, 픽셀 단위 이미지 생성 AI가 더 적은 학습으로 더 좋은 결과를 낸다이미지를 뭉뚱그린 저해상도부터 또렷하게 살려내는 순서로 생성하도록 유도하면, 픽셀 단위 이미지 생성 AI가 더 적은 학습으로 더 좋은 결과를 낸다
- AI 에이전트를 실행시키는 '하니스'마다 성능이 얼마나 다른지 끝까지 추적해서 밝혀내는 평가 엔진AI 에이전트를 실행시키는 '하니스'마다 성능이 얼마나 다른지 끝까지 추적해서 밝혀내는 평가 엔진
- 메모리를 가진 AI 챗봇은 당신이 말하지 않은 것도 절반 가까이 지어내서 '기억'하고, 정작 자기 점검은 이를 제대로 잡아내지 못한다메모리를 가진 AI 챗봇은 당신이 말하지 않은 것도 절반 가까이 지어내서 '기억'하고, 정작 자기 점검은 이를 제대로 잡아내지 못한다
- LG AI연구원, K-EXAONE을 3배 키운 7500억 파라미터 개방형 모델 K-EXAONE 2.0 공개LG AI연구원, K-EXAONE을 3배 키운 7500억 파라미터 개방형 모델 K-EXAONE 2.0 공개
- 이미지를 확대해 보는 AI 툴, 실제로는 답을 바꾸지 않는 경우가 대부분이었다이미지를 확대해 보는 AI 툴, 실제로는 답을 바꾸지 않는 경우가 대부분이었다
- AI 에이전트가 쓰는 '스킬 매뉴얼'을 통째로 읽지 않고, 필요한 절만 골라 안전하게 압축해서 불러오는 방법AI 에이전트가 쓰는 '스킬 매뉴얼'을 통째로 읽지 않고, 필요한 절만 골라 안전하게 압축해서 불러오는 방법
- 해석 가능성을 사후 분석이 아니라 학습 과정 자체에 설계해 넣어도, 모델 성능이 떨어지지 않고 오히려 규모가 커질수록 더 이해하기 쉬워진다는 연구해석 가능성을 사후 분석이 아니라 학습 과정 자체에 설계해 넣어도, 모델 성능이 떨어지지 않고 오히려 규모가 커질수록 더 이해하기 쉬워진다는 연구
- 긴 문서를 줄이는 프롬프트 압축기가 답은 남기고 그 답을 이해할 근거는 지워버리는 경우가 흔하다긴 문서를 줄이는 프롬프트 압축기가 답은 남기고 그 답을 이해할 근거는 지워버리는 경우가 흔하다
- 언어·이미지 이해·이미지 생성을 한 모델에 같이 학습시킬 때 무엇이 서로 돕고 무엇이 서로 방해하는지 실험으로 밝힌 연구언어·이미지 이해·이미지 생성을 한 모델에 같이 학습시킬 때 무엇이 서로 돕고 무엇이 서로 방해하는지 실험으로 밝힌 연구
- AI 에이전트를 속이는 공격을 학습이 아니라 '전략 노트'로 계속 강해지게 만드는 레드팀 시스템AI 에이전트를 속이는 공격을 학습이 아니라 '전략 노트'로 계속 강해지게 만드는 레드팀 시스템
- 경사하강법과 Adam은 같은 행렬을 다르게 골라낸다 — 원인은 손실함수가 못 보는 좌표 대칭성경사하강법과 Adam은 같은 행렬을 다르게 골라낸다 — 원인은 손실함수가 못 보는 좌표 대칭성
- 70B짜리 대형 언어모델 대신 6억~10억 파라미터 소형 모델로도 인간 선택 데이터 예측력을 거의 그대로 재현할 수 있었다70B짜리 대형 언어모델 대신 6억~10억 파라미터 소형 모델로도 인간 선택 데이터 예측력을 거의 그대로 재현할 수 있었다
- 83억 개의 가상 인물로 사람 대신 AI 제품을 테스트하는 인프라, MatrAIx83억 개의 가상 인물로 사람 대신 AI 제품을 테스트하는 인프라, MatrAIx
- 여러 사람의 AI 비서들이 서로 협업할 때, 공격에 뚫리는지 그리고 몰래 정보를 흘리거나 잘못된 권한을 받아들이는지를 동시에 검사하는 실험실여러 사람의 AI 비서들이 서로 협업할 때, 공격에 뚫리는지 그리고 몰래 정보를 흘리거나 잘못된 권한을 받아들이는지를 동시에 검사하는 실험실
- AI 에이전트가 대화 기록을 '개인 스킬'로 압축하면, 사생활 정보와 말투까지 새어나가고 심지어 사용자 행세까지 할 수 있다는 것을 보여준 벤치마크AI 에이전트가 대화 기록을 '개인 스킬'로 압축하면, 사생활 정보와 말투까지 새어나가고 심지어 사용자 행세까지 할 수 있다는 것을 보여준 벤치마크
- LLM 에이전트가 경험을 쌓을수록 오히려 헷갈려 하는 문제를, 기억을 4칸짜리 서랍으로 압축해 해결한 연구LLM 에이전트가 경험을 쌓을수록 오히려 헷갈려 하는 문제를, 기억을 4칸짜리 서랍으로 압축해 해결한 연구
- AI 에이전트가 스스로 배운 '기술(skill)'에 악성 백도어를 숨겨 학습시킬 수 있다는 공격이 나왔다AI 에이전트가 스스로 배운 '기술(skill)'에 악성 백도어를 숨겨 학습시킬 수 있다는 공격이 나왔다
- 이미지 편집 대화에서 '다음엔 뭘 편집할까요?'를 사용자 클릭과 실제 이미지에 맞춰 추천하는 3단계 학습법이미지 편집 대화에서 '다음엔 뭘 편집할까요?'를 사용자 클릭과 실제 이미지에 맞춰 추천하는 3단계 학습법
- 텐센트 Hunyuan팀, 3D 이해·생성·편집을 한 모델로 묶은 Buffalo 1.0 공개텐센트 Hunyuan팀, 3D 이해·생성·편집을 한 모델로 묶은 Buffalo 1.0 공개
- 사람이 1인칭 시점으로 찍은 물건 조작 영상을 로봇 학습 데이터로 바꿔, 18,561시간짜리 15종 로봇용 데이터셋을 만들고 실제로 정책 일반화에 도움이 되는지 검증했다사람이 1인칭 시점으로 찍은 물건 조작 영상을 로봇 학습 데이터로 바꿔, 18,561시간짜리 15종 로봇용 데이터셋을 만들고 실제로 정책 일반화에 도움이 되는지 검증했다
- 코딩 에이전트가 작업 중 사용자가 코드를 직접 고쳐버리면 얼마나 무너지는지 실측한 벤치마크코딩 에이전트가 작업 중 사용자가 코드를 직접 고쳐버리면 얼마나 무너지는지 실측한 벤치마크
- 목소리 없이도 캡션 한 줄로 배우를 만들고, 나중엔 그 목소리를 그대로 재사용하는 통합 음성·오디오 생성 모델목소리 없이도 캡션 한 줄로 배우를 만들고, 나중엔 그 목소리를 그대로 재사용하는 통합 음성·오디오 생성 모델
- KV 캐시를 확 줄여도, 8개짜리 '복구용 토큰'을 추가해 원래 성능에 가깝게 되돌리는 방법KV 캐시를 확 줄여도, 8개짜리 '복구용 토큰'을 추가해 원래 성능에 가깝게 되돌리는 방법
- 복잡하고 붐비는 '글로벌 사우스' 도시 영상을 위해, AI가 미래를 예측할 때 '레이아웃-사람-상호작용'을 따로 나눠 보게 만든 연구복잡하고 붐비는 '글로벌 사우스' 도시 영상을 위해, AI가 미래를 예측할 때 '레이아웃-사람-상호작용'을 따로 나눠 보게 만든 연구
- 로봇이 미래를 예측하는 학습에서, 예측 목표를 행동을 만드는 바로 그 정책 자신에게서 뽑아내면 더 잘 작동한다로봇이 미래를 예측하는 학습에서, 예측 목표를 행동을 만드는 바로 그 정책 자신에게서 뽑아내면 더 잘 작동한다
- 뇌파(MEG)만 보고 3초짜리 들은 말소리를 맞히는 AI를 뜯어보니, 뇌의 어느 부위와 소리의 어떤 특징이 실제로 쓰이는지 알 수 있었다뇌파(MEG)만 보고 3초짜리 들은 말소리를 맞히는 AI를 뜯어보니, 뇌의 어느 부위와 소리의 어떤 특징이 실제로 쓰이는지 알 수 있었다
- 3D 공간 질문응답 AI, 토큰을 1400개에서 128개로 줄여도 성능은 94.7% 유지3D 공간 질문응답 AI, 토큰을 1400개에서 128개로 줄여도 성능은 94.7% 유지
- AI 에이전트를 하루짜리 대화가 아니라 계속 바뀌는 업무 환경에서 시험하면, 안전 실패가 훨씬 더 많이 드러난다AI 에이전트를 하루짜리 대화가 아니라 계속 바뀌는 업무 환경에서 시험하면, 안전 실패가 훨씬 더 많이 드러난다
- AI가 답할 수 없는 질문은 거부하고, 답할 수 있는 애매한 질문은 계속 답하는지 41000개 문항으로 시험하는 벤치마크 MMOOCAI가 답할 수 없는 질문은 거부하고, 답할 수 있는 애매한 질문은 계속 답하는지 41000개 문항으로 시험하는 벤치마크 MMOOC
- AI가 3D 형태를 한번에 뱉지 않고, 사람처럼 한 단계씩 CAD 도면을 만들어간다AI가 3D 형태를 한번에 뱉지 않고, 사람처럼 한 단계씩 CAD 도면을 만들어간다
- 영상을 만들지 않고, 만들어지는 중인 영상의 '속마음'만 읽어서 물체가 어떻게 움직일지 예측하는 AI영상을 만들지 않고, 만들어지는 중인 영상의 '속마음'만 읽어서 물체가 어떻게 움직일지 예측하는 AI
- 모델은 그대로 두고 '틀(하네스)'만 자연선택으로 진화시켜 AI 에이전트 성능을 끌어올렸다모델은 그대로 두고 '틀(하네스)'만 자연선택으로 진화시켜 AI 에이전트 성능을 끌어올렸다
- 구글의 DiffusionGemma는 한 번에 256개 토큰 블록을 동시에 다듬어서 기존 AR 모델보다 훨씬 빠르게 텍스트를 생성하는 실험적 개방형 언어모델이다구글의 DiffusionGemma는 한 번에 256개 토큰 블록을 동시에 다듬어서 기존 AR 모델보다 훨씬 빠르게 텍스트를 생성하는 실험적 개방형 언어모델이다
- LLM 에이전트에게 365일짜리 온라인 쇼핑몰을 맡겨봤더니, 사람보다 훨씬 빨리 자산 관리에 흥미를 잃었다LLM 에이전트에게 365일짜리 온라인 쇼핑몰을 맡겨봤더니, 사람보다 훨씬 빨리 자산 관리에 흥미를 잃었다
- AI가 못 푸는 문제를 만나면 그럴듯한 거짓 풀이를 계속 늘어놓는다는 문제를 진단하고, '모르겠다'고 포기하도록 훈련시킨 연구AI가 못 푸는 문제를 만나면 그럴듯한 거짓 풀이를 계속 늘어놓는다는 문제를 진단하고, '모르겠다'고 포기하도록 훈련시킨 연구
- 정답 채점 강화학습과 선생님 모방 학습을 그냥 더하면 AI가 모험을 멈춘다 - SAF는 그 폭주하는 신호를 다듬어 더 나은 결과를 낸다정답 채점 강화학습과 선생님 모방 학습을 그냥 더하면 AI가 모험을 멈춘다 - SAF는 그 폭주하는 신호를 다듬어 더 나은 결과를 낸다
- AI 에이전트가 실패했을 때, 잘못은 모델인가 도구인가 환경인가를 구분하는 분류법AI 에이전트가 실패했을 때, 잘못은 모델인가 도구인가 환경인가를 구분하는 분류법
- Qwen-UI-Agent는 시뮬레이터가 아니라 실제 폰과 컴퓨터에서 화면 클릭과 명령줄 명령을 섞어 쓰며 여러 단계 작업을 끝내는 GUI 에이전트다Qwen-UI-Agent는 시뮬레이터가 아니라 실제 폰과 컴퓨터에서 화면 클릭과 명령줄 명령을 섞어 쓰며 여러 단계 작업을 끝내는 GUI 에이전트다
- AI 코딩 모델은 코드를 지우라는 지시를 받아도 옛 코드를 몰래 남겨둔다AI 코딩 모델은 코드를 지우라는 지시를 받아도 옛 코드를 몰래 남겨둔다
- AI 에이전트가 컴퓨터 작업을 '진짜로' 끝냈는지 판정하는 AI 채점관들이 사실은 잘 속는다는 것을 처음으로 체계적으로 밝혀낸 연구AI 에이전트가 컴퓨터 작업을 '진짜로' 끝냈는지 판정하는 AI 채점관들이 사실은 잘 속는다는 것을 처음으로 체계적으로 밝혀낸 연구
- 집안일을 하는 사람의 눈, 몸, 손, 소리, 촉감을 동시에 녹화하는 장비로 로봇 학습용 데이터를 만들었다집안일을 하는 사람의 눈, 몸, 손, 소리, 촉감을 동시에 녹화하는 장비로 로봇 학습용 데이터를 만들었다
- AI 모델이 답을 배우기 전, 원칙 자체를 먼저 읽게 하면 안전 행동이 더 오래 유지된다AI 모델이 답을 배우기 전, 원칙 자체를 먼저 읽게 하면 안전 행동이 더 오래 유지된다
- 말하는 얼굴 영상을 1스텝 추론으로 실시간 200프레임까지 뽑아내면서도 얼굴이 흐트러지지 않게 만든 기술말하는 얼굴 영상을 1스텝 추론으로 실시간 200프레임까지 뽑아내면서도 얼굴이 흐트러지지 않게 만든 기술
- 영상 생성 AI에게 자연어 대신 '실행 가능한 블렌더 코드'로 물리 법칙을 미리 그려주게 한 연구영상 생성 AI에게 자연어 대신 '실행 가능한 블렌더 코드'로 물리 법칙을 미리 그려주게 한 연구
- 속도를 위해 정확도를 몰래 희생하는 스펙큘레이티브 디코딩 검증법들의 실체를 밝히다속도를 위해 정확도를 몰래 희생하는 스펙큘레이티브 디코딩 검증법들의 실체를 밝히다
- 선생님보다 약한 모델들만 모아 학생 AI를 더 강하게 만드는 증류법선생님보다 약한 모델들만 모아 학생 AI를 더 강하게 만드는 증류법
- 멀티모달 AI가 이미지를 못 보는 게 아니라, 봤는데도 통제가 안 되는 것이다멀티모달 AI가 이미지를 못 보는 게 아니라, 봤는데도 통제가 안 되는 것이다
- 오디오·비디오를 동시에 이해하는 AI에서, 한쪽 감각이 다른 쪽을 대신 판단하게 하면 답이 사라진다오디오·비디오를 동시에 이해하는 AI에서, 한쪽 감각이 다른 쪽을 대신 판단하게 하면 답이 사라진다
- AI 음성 비서가 상황에 따라 끼어들거나 기다리는 방식을 바꾸려면 소량의 사람 평가만으로도 가능하다AI 음성 비서가 상황에 따라 끼어들거나 기다리는 방식을 바꾸려면 소량의 사람 평가만으로도 가능하다
- 로봇이 원하는 결과를 상상만 하면, 세계모델이 탐색 없이 바로 실행할 행동을 내놓는 법로봇이 원하는 결과를 상상만 하면, 세계모델이 탐색 없이 바로 실행할 행동을 내놓는 법
- AI가 대화 기록을 지우고도 정답을 맞히는 건, 지운 정보가 남은 캐시에 몰래 새겨져 있기 때문이다AI가 대화 기록을 지우고도 정답을 맞히는 건, 지운 정보가 남은 캐시에 몰래 새겨져 있기 때문이다
- 모델의 속마음을 읽어주는 AI 통역사(Activation Oracle)를 훈련시켰더니, 자신이 훈련받은 바로 그 비밀만 못 읽는 이상한 통역사가 됐다모델의 속마음을 읽어주는 AI 통역사(Activation Oracle)를 훈련시켰더니, 자신이 훈련받은 바로 그 비밀만 못 읽는 이상한 통역사가 됐다
- AI 리서치 에이전트에 가짜 논문 한 편만 슬쩍 끼워도 최종 보고서가 거짓 결론을 채택한다AI 리서치 에이전트에 가짜 논문 한 편만 슬쩍 끼워도 최종 보고서가 거짓 결론을 채택한다
- AI 안전성 테스트가 '문제없음'을 증명할 때, 그 증거의 힘에는 계산 가능한 한계가 있다AI 안전성 테스트가 '문제없음'을 증명할 때, 그 증거의 힘에는 계산 가능한 한계가 있다
- 긴 재무제표를 통째로 주고 공식 힌트를 빼면, 최신 AI들도 계산을 반쯤 틀린다긴 재무제표를 통째로 주고 공식 힌트를 빼면, 최신 AI들도 계산을 반쯤 틀린다
- 트랜스포머가 예전 층의 정보를 다시 읽어올 때, 질문을 하나만 던지지 말고 특징별로 여러 개 던지게 했더니 더 좋아졌다트랜스포머가 예전 층의 정보를 다시 읽어올 때, 질문을 하나만 던지지 말고 특징별로 여러 개 던지게 했더니 더 좋아졌다
- 여러 페르소나를 가진 LLM들이 서로 토론하며 단체 여행 일정을 합의하는 시뮬레이션 틀여러 페르소나를 가진 LLM들이 서로 토론하며 단체 여행 일정을 합의하는 시뮬레이션 틀
- 자율주행차가 대비해야 할 위험한 보행자 유형에 7가지가 추가됐다자율주행차가 대비해야 할 위험한 보행자 유형에 7가지가 추가됐다
- 영상 편집 AI가 소리도 같이 잘 고치는지 처음으로 제대로 시험하는 벤치마크와, 그걸 잘 해내는 에이전트를 함께 내놓았다영상 편집 AI가 소리도 같이 잘 고치는지 처음으로 제대로 시험하는 벤치마크와, 그걸 잘 해내는 에이전트를 함께 내놓았다