음성·소리를 알아듣는 AI, 지시문 학습 없이 '연결 다리'만 훈련해도 충분하다
음성·소리를 알아듣는 AI, 지시문 학습 없이 '연결 다리'만 훈련해도 충분하다
연구팀은 오디오를 이해하는 대형언어모델(LALM)을 만들 때 흔히 거치는 지시문 학습(SFT)과 선호도 최적화 단계를 생략하고, 오디오 인코더와 언어모델(LLM)을 모두 고정한 채 그 사이를 잇는 작은 변환기(프로젝터)만 학습시켰다. 이 변환기는 오디오를 캡션(설명 문장)과 똑같이 취급하도록 학습되며, 사람이 만든 질문-답변 데이터 없이 LLM 스스로 만든 데이터로 훈련된다. 그 결과 훨씬 적은 데이터로도 기존의 무겁게 후처리된 오디오 AI 모델들과 맞먹거나 앞서는 성능을 냈다.
METAL MEDIA 해설 도표
음성·소리를 알아듣는 AI, 지시문 학습 없이 '연결 다리'만 훈련해도 충분하다
- 01기존 방식은 오디오 인코더와 LLM을 이어붙인 뒤 지시문-정답 데이터로 추가 학습(SFT)과 선호도 최적화까지 거치는데, 이 과정에서 LLM이 원래 갖고 있던 범용 지시 수행 능력이 오히려 손상될 수 있다는 문제의식에서 출발했다.
- 02해결책은 오디오 인코더와 LLM을 둘 다 얼려서(가중치를 바꾸지 않고) 그 사이를 연결하는 가벼운 프로젝터(MLP 두 층)만 학습시키는 것이다. 학습 데이터는 사람이 만든 지시문 없이, 오디오에 딸린 캡션을 LLM에 넣어 LLM이 스스로 만들어낸 자유형 답변을 정답으로 사용해 자동 생성했다.
- 03MMAU, MMAR, MMSU, MMAU-Pro 네 개 벤치마크에서 평가한 결과, AudioSet-Zipformer 인코더를 쓴 모델이 MMAU Sound 항목에서 80.8/77.4점을 기록해 기존 오픈소스 최고 모델(Audio-Flamingo 3, 79.6/75.8점)을 앞질렀는데, 이 모델은 46배 많은 샘플과 34배 많은 오디오로 학습된 것이었다.
- 04MMAU-Pro의 지시 수행(IF) 항목에서는 62.9/72.6점으로 모든 오픈소스 오디오 AI 중 1위(기존 최고 61.3점)를 기록했는데, 이는 LLM을 건드리지 않아 원래의 지시 수행 능력이 그대로 보존됐기 때문이다.
- 05오디오 인코더 5종, LLM 2종(Qwen2.5-7B-Instruct, Qwen3-8B)을 바꿔가며 실험한 결과, 성능은 인코더가 담고 있는 정보량과 LLM의 능력 두 가지에 동시에 제약받으며, 데이터를 10배(400K→4M) 늘려도 객관식 문제(MMAU)는 거의 정체되고 열린 답변형 문제(MMAR, MMAU-Pro Open-ended)만 개선되는 경향을 보였다.
무엇을 했나
- 기존 방식은 오디오 인코더와 LLM을 이어붙인 뒤 지시문-정답 데이터로 추가 학습(SFT)과 선호도 최적화까지 거치는데, 이 과정에서 LLM이 원래 갖고 있던 범용 지시 수행 능력이 오히려 손상될 수 있다는 문제의식에서 출발했다.
- 해결책은 오디오 인코더와 LLM을 둘 다 얼려서(가중치를 바꾸지 않고) 그 사이를 연결하는 가벼운 프로젝터(MLP 두 층)만 학습시키는 것이다. 학습 데이터는 사람이 만든 지시문 없이, 오디오에 딸린 캡션을 LLM에 넣어 LLM이 스스로 만들어낸 자유형 답변을 정답으로 사용해 자동 생성했다.
- MMAU, MMAR, MMSU, MMAU-Pro 네 개 벤치마크에서 평가한 결과, AudioSet-Zipformer 인코더를 쓴 모델이 MMAU Sound 항목에서 80.8/77.4점을 기록해 기존 오픈소스 최고 모델(Audio-Flamingo 3, 79.6/75.8점)을 앞질렀는데, 이 모델은 46배 많은 샘플과 34배 많은 오디오로 학습된 것이었다.
- MMAU-Pro의 지시 수행(IF) 항목에서는 62.9/72.6점으로 모든 오픈소스 오디오 AI 중 1위(기존 최고 61.3점)를 기록했는데, 이는 LLM을 건드리지 않아 원래의 지시 수행 능력이 그대로 보존됐기 때문이다.
- 오디오 인코더 5종, LLM 2종(Qwen2.5-7B-Instruct, Qwen3-8B)을 바꿔가며 실험한 결과, 성능은 인코더가 담고 있는 정보량과 LLM의 능력 두 가지에 동시에 제약받으며, 데이터를 10배(400K→4M) 늘려도 객관식 문제(MMAU)는 거의 정체되고 열린 답변형 문제(MMAR, MMAU-Pro Open-ended)만 개선되는 경향을 보였다.

| Model | Size | Training Data | MMAU (test-mini / test) | MMAR | MMSU | MMAU-Pro | |||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| # Samples | # Hours | Sound | Music | Speech | Avg. | Avg. | Avg. | IF | Open-ended | Avg. | ||
| Proprietary models | |||||||||||
| GPT-4o mini Audio [62] | – | – | 50.8 / 49.7 | 39.2 / 36.0 | 69.1 / 67.5 | 53.0 / 51.0 | 50.6 | – | 79.7 | 41.6 | 48.3 |
| GPT-4o-Audio [62] | – | – | 64.6 / 63.2 | 56.3 / 49.9 | 66.7 / 69.3 | 62.5 / 60.8 | 63.5 | 56.4 | 82.5 | 43.2 | 52.5 |
| Gemini 2.0 Flash [30] | – | – | 71.2 / 68.9 | 65.3 / 59.3 | 75.1 / 72.9 | 70.5 / 67.0 | 65.6 | 51.0 | 94.2 | 66.8 | 55.7 |
| Gemini 2.5 Flash [31] | – | – | 73.3 / 69.5 | 65.6 / 69.4 | 76.6 / 68.3 | 71.8 / 67.4 | 68.4 | – | 95.1 | 67.5 | 59.2 |
| Open-source/access LALMs | |||||||||||
| SALMONN [75] | 13B | 2.3M | 4.4K | 41.1 / 42.1 | 37.1 / 37.8 | 26.4 / 28.8 | 34.9 / 36.2 | 33.2 | 30.1 | 38.5 | 33.6 | 39.6 |
| LTU [29] | 7B | 5.6M | – | 20.4 / 20.7 | 16.0 / 15.7 | 15.9 / 15.3 | 17.4 / 17.2 | 19.2 | 22.6 | – | – | – |
| Qwen2-Audio-Instruct [12] | 7B | – | 320K | 67.3 / 61.2 | 56.3 / 55.7 | 55.3 / 55.4 | 59.6 / 57.4 | 30.0 | 53.3 | – | – | – |
| Qwen2.5-Omni [84] | 7B | – | – | 78.1 / 76.8 | 65.9 / 67.3 | 70.6 / 68.9 | 71.5 / 71.0 | 56.7 | 60.6 | 61.3 | 52.3 | 52.2 |
| Audio-Flamingo 2 [25] | 3B | 5.9M | – | 71.5 / 68.1 | 71.0 / 70.2 | 44.7 / 44.9 | 62.4 / 61.1 | 21.9 | – | 29.6 | 43.2 | 42.6 |
| Audio-Flamingo 3 [26] | 8B | 26.7M | 54.4K | 79.6 / 75.8 | 74.0 / 74.5 | 66.4 / 67.0 | 73.3 / 72.4 | 58.5 | – | 33.3 | 44.2 | 51.7 |
| Kimi-Audio [43] | 7B | – | 13.3M | 75.7 / 70.7 | 66.8 / 65.9 | 62.2 / 56.6 | 68.2 / 64.4 | – | 59.3 | 42.3 | 34.5 | 46.6 |
| ALARM [33] | 4B | 5.5M | 17K | 64.0 / 59.1 | 54.8 / 54.2 | 77.2 / 73.7 | 65.3 / 62.4 | 48.7 | 61.3 | – | – | – |
| Ours (AudioSet-Zipformer) | 7B | 576.8K | 1.6K | 80.8 / 77.4 | 69.8 / 68.6 | 54.1 / 52.8 | 68.2 / 66.3 | 54.3 | 47.0 | 62.9 | 50.8 | 52.8 |
| Ours (Whisper-large-v2) | 7B | 576.8K | 1.6K | 75.7 / 72.5 | 62.9 / 61.3 | 60.4 / 60.1 | 66.3 / 64.6 | 52.3 | 50.6 | 72.6 | 55.4 | 48.4 |

| Audio Encoder | Size | Down. r | MMAU (test-mini) | MMAR | MMSU | MMAU-Pro | |||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| Sound | Music | Speech | Avg. | Avg. | Avg. | IF | Open-ended | Avg. | |||
| Discriminative pretraining | |||||||||||
| AudioSet-Zipformer | 7B | 4 | 80.78 | 69.76 | 54.05 | 68.20 | 54.30 | 47.00 | 62.91 | 50.84 | 52.82 |
| ASR-supervised pretraining | |||||||||||
| Whisper-large-v2 | 7B | 4 | 75.68 | 62.87 | 60.36 | 66.30 | 52.30 | 50.61 | 72.57 | 55.39 | 48.40 |
| Qwen3-ASR AuT encoder | 7B | 2 | 63.36 | 51.80 | 55.15 | 56.80 | 47.20 | 45.15 | 59.43 | 52.12 | 41.92 |
| Joint audio-language pretraining | |||||||||||
| Qwen2.5-Omni audio encoder | 7B | 4 | 68.77 | 50.9 | 45.65 | 55.10 | 48.30 | 43.31 | 67.74 | 53.77 | 45.24 |
| Qwen3-Omni AuT encoder | 7B | 2 | 67.87 | 60.78 | 54.95 | 61.20 | 48.40 | 45.81 | 67.74 | 60.59 | 47.32 |
| LLM Backbone | Size | 𝒮 Generator | MMAU (test-mini) | MMAR | MMSU | MMAU-Pro | |||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| Sound | Music | Speech | Avg. | Avg. | Avg. | IF | Open-ended | Avg. | |||
| Qwen2.5 family | |||||||||||
| Qwen2.5-7B-Instruct | 7B | Qwen2.5-7B-Instruct | 67.87 | 60.78 | 54.95 | 61.20 | 48.40 | 45.81 | 67.74 | 60.59 | 47.32 |
| Qwen3 family | |||||||||||
| Qwen3-8B | 8B | Qwen2.5-7B-Instruct | 63.44 | 55.18 | 45.43 | 54.70 | 48.10 | 45.84 | 61.09 | 50.32 | 40.54 |
| Qwen3-8B | 8B | Qwen3-8B | 66.77 | 61.80 | 53.25 | 60.60 | 49.80 | 46.86 | 67.74 | 54.81 | 48.31 |
| Setting | MMAU (test-mini) | |||
|---|---|---|---|---|
| Sound | Music | Speech | Avg. | |
| Alignment Only | 75.68 | 62.87 | 60.36 | 66.30 |
| Alignment → SFT | 70.87 | 58.68 | 65.47 | 65.00 |
| Dataset | #audio/#cap | Domain | Audio source | Caption style | Caption generation pipeline | ||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AudioCaps | AudioCaps | 46k/46k | general (environmental, human/animal sounds) | general (environmental, | human/animal sounds) | AudioSet | AudioSet | Human-annotated, short description | Human-annotated, short description | crowdsourced | |||||||||
| AudioCaps | |||||||||||||||||||
| general (environmental, | |||||||||||||||||||
| human/animal sounds) | |||||||||||||||||||
| AudioSet | |||||||||||||||||||
| Human-annotated, short description | |||||||||||||||||||
| Clotho | Clotho | 5k/25k | environmental sounds | FreeSound | Human-annotated, short description | Human-annotated, short description | crowdsourced | ||||||||||||
| Clotho | |||||||||||||||||||
| Human-annotated, short description | |||||||||||||||||||
| MusicCaps | MusicCaps | 3k/3k | music | AudioSet | AudioSet | Expert musician-written, multi-sentence, fine-grained description | Expert musician-written, | multi-sentence, fine-grained description | expert curation | ||||||||||
| MusicCaps | |||||||||||||||||||
| AudioSet | |||||||||||||||||||
| Expert musician-written, | |||||||||||||||||||
| multi-sentence, fine-grained description | |||||||||||||||||||
| WavCaps | WavCaps | 400k/400k | general (environmental, human/animal sounds) | general (environmental, | human/animal sounds) | AudioSet BBC Sound Effect FreeSound SoundBible | AudioSet | BBC Sound Effect | FreeSound | SoundBible | LLM-refined captions | three-stage pipeline: web-crawled raw descriptions → ChatGPT rewrite → filtering | three-stage pipeline: | web-crawled raw descriptions | → ChatGPT rewrite → filtering | ||||
| WavCaps | |||||||||||||||||||
| general (environmental, | |||||||||||||||||||
| human/animal sounds) | |||||||||||||||||||
| AudioSet | |||||||||||||||||||
| BBC Sound Effect | |||||||||||||||||||
| FreeSound | |||||||||||||||||||
| SoundBible | |||||||||||||||||||
| three-stage pipeline: | |||||||||||||||||||
| web-crawled raw descriptions | |||||||||||||||||||
| → ChatGPT rewrite → filtering | |||||||||||||||||||
| AudioSetCaps | AudioSetCaps | 1.9M/1.9M 4.0M/4.0M 182k/182k | 1.9M/1.9M | 4.0M/4.0M | 182k/182k | general (environmental, human/animal sounds) | general (environmental, | human/animal sounds) | AudioSet YouTube8M VggSound | AudioSet | YouTube8M | VggSound | LLM-generated, detailed, multi-sentence description | LLM-generated, detailed, | multi-sentence description | three-stage pipeline: LALM attribute extraction → LLM captioning → CLAP-based filtering | three-stage pipeline: | LALM attribute extraction | → LLM captioning |
| AudioSetCaps | |||||||||||||||||||
| 1.9M/1.9M | |||||||||||||||||||
| 4.0M/4.0M | |||||||||||||||||||
| 182k/182k |
| Dataset | Caption Source | Audio Coverage | Hours (h) | Purpose |
|---|---|---|---|---|
| Caption corpora (CaptionStew subsets) | ||||
| CaptionStew-400K [78] | open-source caption | Sp / So / Mu | 1,351 | IFA |
| CaptionStew-1M [78] | open-source caption | Sp / So / Mu | 3,475 | IFA |
| CaptionStew-4M [78] | open-source caption | Sp / So / Mu | 13,934 | IFA |
| Qwen3-Omni-Captioner on CS-400K [91] | captioner-generated | Sp / So / Mu | 1,351 | IFA |
| Speech corpora (10% mixture, transcripts / paralinguistic labels as caption surrogate) | ||||
| DailyTalk [47] | transcript, emotion | Sp | 21 | IFA |
| CREMA-D [7] | transcript, gender, age, emotion | Sp | 5 | IFA |
| RAVDESS [54] | transcript, gender, emotion | Sp | 1 | IFA |
| TESS [65] | transcript, gender, age, emotion | Sp | 1 | IFA |
| MELD [66] | transcript, gender, emotion | Sp | 8 | IFA |
| IEMOCAP [6] | transcript, gender, emotion | Sp | 9 | IFA |
| VoxCeleb2 [15] | transcript, gender | Sp | 2,026 | IFA |
| CommonVoice-en [2] | transcript, gender, age | Sp | 1,199 | IFA |
| QA corpus (targeted speech SFT) | ||||
| AudioSkills-XL [26] (speech subset, | QA pairs | Sp | 234 | SFT |
| incl. VoxCeleb2, GigaSpeech) |
| Audio Encoder | Down. r | MMAU (test-mini) | MMAR | MMSU | MMAU-Pro | |||||
|---|---|---|---|---|---|---|---|---|---|---|
| Sound | Music | Speech | Avg. | Avg. | Avg. | IF | Open-ended | Avg. | ||
| Discriminative pretraining | ||||||||||
| AudioSet-Zipformer | 4 | 80.78 | 69.76 | 54.05 | 68.2 | 54.3 | 47.00 | 62.91 | 50.84 | 52.82 |
| 2 | 76.58 | 64.37 | 51.35 | 64.1 | 53.0 | 47.17 | 60.22 | 55.01 | 49.40 | |
| ASR-supervised pretraining | ||||||||||
| Whisper-large-v2 | 16 | 67.57 | 59.58 | 49.25 | 58.8 | 48.5 | 43.48 | 58.77 | 55.67 | 48.75 |
| 8 | 69.07 | 63.17 | 50.75 | 61.0 | 52.0 | 45.92 | 58.05 | 48.82 | 43.49 | |
| 4 | 75.68 | 62.87 | 60.36 | 66.3 | 52.3 | 50.61 | 72.57 | 55.39 | 48.40 | |
| 2 | 63.96 | 42.81 | 31.53 | 46.1 | 24.0 | 43.50 | 50.86 | 43.21 | 27.83 | |
| Joint audio-language pretraining | ||||||||||
| Qwen2.5-Omni audio encoder | 4 | 68.77 | 50.9 | 45.65 | 55.1 | 48.3 | 43.31 | 67.74 | 53.77 | 45.24 |
| 2 | 70.27 | 53.29 | 53.31 | 59.0 | 48.0 | 45.41 | 58.05 | 49.46 | 45.89 | |
| Qwen3-Omni AuT encoder | 2 | 67.87 | 60.78 | 54.95 | 61.2 | 48.4 | 45.81 | 67.74 | 60.59 | 47.32 |
| 1 | 66.97 | 53.89 | 56.76 | 59.2 | 49.4 | 48.28 | 77.43 | 51.29 | 50.97 |
| Audio Encoder | Training Data | MMAU (test-mini) | MMAR | MMSU | MMAU-Pro | |||||
|---|---|---|---|---|---|---|---|---|---|---|
| # Samples | # Hours | Sound | Music | Speech | Avg. | Avg. | Avg. | IF | Open-ended | Avg. | |
| Discriminative pretraining | ||||||||||
| AudioSet-Zipformer | 576.8K | 1.6K | 80.78 | 69.76 | 54.05 | 68.20 | 54.30 | 47.00 | 62.91 | 50.84 | 52.82 |
| 1.18M | 3.7K | 80.48 | 67.66 | 53.15 | 67.10 | 57.40 | 54.47 | 67.74 | 58.92 | 51.07 | |
| 4.18M | 14.2K | 80.28 | 67.37 | 54.25 | 67.30 | 58.10 | 51.81 | 72.57 | 67.52 | 53.19 | |
| ASR-supervised pretraining | ||||||||||
| Whisper-large-v2 | 576.8K | 1.6K | 75.68 | 62.87 | 60.36 | 66.30 | 52.30 | 50.61 | 72.57 | 55.39 | 48.40 |
| 1.18M | 3.7K | 75.98 | 68.56 | 54.95 | 66.50 | 54.20 | 50.27 | 71.87 | 49.25 | 51.35 | |
| 4.18M | 14.2K | 75.98 | 64.37 | 52.55 | 64.30 | 54.90 | 51.56 | 72.88 | 56.27 | 50.29 | |
| Joint audio-language pretraining | ||||||||||
| Qwen2.5-Omni audio encoder | 576.8K | 1.6K | 70.27 | 53.29 | 53.31 | 59.00 | 48.00 | 45.41 | 58.05 | 49.46 | 45.89 |
| 1.18M | 3.7K | 71.07 | 57.78 | 49.75 | 59.50 | 48.30 | 46.36 | 62.91 | 50.40 | 46.39 | |
| 4.18M | 14.2K | 69.77 | 59.28 | 49.75 | 59.60 | 48.50 | 46.36 | 67.74 | 55.15 | 46.15 | |
| Qwen3-Omni AuT encoder | 576.8K | 1.6K | 67.87 | 60.78 | 54.95 | 61.20 | 48.40 | 45.81 | 67.74 | 60.59 | 47.32 |
| 1.18M | 3.7K | 67.57 | 60.48 | 54.65 | 60.90 | 50.20 | 44.88 | 67.74 | 59.25 | 47.64 | |
| 4.18M | 14.2K | 69.77 | 61.98 | 52.55 | 61.40 | 53.00 | 42.37 | 62.88 | 62.31 | 48.81 |
| Audio Encoder | Caption Source | MMAU (test-mini) | MMAR | MMSU | MMAU-Pro | |||||
|---|---|---|---|---|---|---|---|---|---|---|
| Sound | Music | Speech | Avg. | Avg. | Avg. | IF | Open-ended | Avg. | ||
| Discriminative pretraining | ||||||||||
| AudioSet-Zipformer | Ground-truth | 80.78 | 69.76 | 54.05 | 68.20 | 54.30 | 47.00 | 62.91 | 50.84 | 52.82 |
| Synthetic | 79.50 | 68.26 | 50.15 | 66.00 | 51.30 | 47.19 | 56.93 | 54.62 | 48.00 | |
| ASR-supervised pretraining | ||||||||||
| Whisper-large-v2 | Ground-truth | 69.07 | 63.17 | 50.75 | 61.00 | 52.00 | 45.92 | 58.05 | 48.82 | 43.49 |
| Synthetic | 62.76 | 58.98 | 49.55 | 57.10 | 44.10 | 44.26 | 58.51 | 56.68 | 40.20 | |
| Joint audio-language pretraining | ||||||||||
| Qwen2.5-Omni audio encoder | Ground-truth | 70.27 | 53.29 | 53.31 | 59.00 | 48.00 | 45.41 | 58.05 | 49.46 | 45.89 |
| Synthetic | 50.76 | 46.34 | 41.95 | 46.40 | 36.20 | 48.61 | 77.09 | 40.65 | 39.46 | |
| Qwen3-Omni AuT encoder | Ground-truth | 67.87 | 60.78 | 54.95 | 61.20 | 48.40 | 45.81 | 67.74 | 60.59 | 47.32 |
| Synthetic | 60.96 | 58.68 | 60.96 | 60.20 | 49.80 | 50.43 | 78.72 | 44.22 | 45.09 |
왜 중요한가
오디오 AI를 새 LLM에 맞춰 다시 만들 때마다 막대한 지시문 데이터와 학습 비용을 들이는 대신, 가벼운 연결 장치 하나만 다시 학습하면 되는 방법을 보여줘 모델 업데이트 비용을 크게 줄일 수 있다. 또한 사람이 만든 질문-답변 데이터셋이 없어도 오디오 이해 AI를 자동으로 만들 수 있다는 점에서, 데이터 구축에 드는 인력과 시간을 절약할 방법을 제시한다.
이 논문의 용어
- 프로젝터(Projector) · 오디오 인코더가 뽑아낸 특징을 언어모델이 이해할 수 있는 형태로 바꿔주는 작은 신경망 변환기
- 지시문 학습(SFT, Supervised Fine-Tuning) · 모델에게 질문과 정답 예시를 주어 특정 작업을 수행하도록 추가로 훈련시키는 단계
- 인스트럭션-프리(Instruction-Free) 학습 · 질문이나 지시문 없이 오디오만 입력해 모델이 스스로 적절한 반응을 만들어내도록 훈련하는 방식
- 캡션(Caption) · 오디오 내용을 글로 설명한 문장으로, 이 연구에서는 오디오 대신 학습 정답을 만드는 재료로 쓰임
- 동결(Frozen) 파라미터 · 학습 중에 가중치 값을 바꾸지 않고 그대로 유지하는 모델 부분
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Xuanru Zhou et al., arXiv:2608.18132, CC BY 4.0