K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

Efficient Adaptation of LLMs for Hate Speech Detection in Low-Resource Languages: A Comparative Study on Roman Urdu

arXiv:2608.181422026-08-20

识别用拉丁字母拼写的乌尔都语(罗马乌尔都语)仇恨言论,只调整AI模型一小部分参数就能大幅提升效果

罗马乌尔都语是南亚社交媒体上广泛使用的非正式乌尔都语拼写方式,因为没有统一拼写规则,AI很难识别其中的仇恨言论。研究团队测试了Mistral、LLaMA、Falcon、Gemma、DeepSeek和多语言BERT六个语言模型,分别在完全不训练直接使用(零样本)和用LoRA方法只微调一小部分参数两种条件下进行对比。零样本模式下表现最好的模型F1分数也只有0.56左右,而经过LoRA微调后,表现最好的Mistral-7B的F1分数超过0.93。

METAL MEDIA 解读图

识别用拉丁字母拼写的乌尔都语(罗马乌尔都语)仇恨言论,只调整AI模型一小部分参数就能大幅提升效果

  1. 01使用包含超过7.2万条罗马乌尔都语社交媒体评论的PURUTT数据集,其中约18%被标注为仇恨性内容
  2. 02在零样本(不做任何训练)和LoRA微调(只训练约700万个参数,并用4比特量化技术节省显存)两种条件下对六个Transformer模型进行比较
  3. 03零样本模型普遍容易把正常评论误判为仇恨言论,不同模型的F1分数在0.15到0.56之间波动
  4. 04经过LoRA微调后,所有模型的F1分数提升到0.75至0.94之间,其中Mistral-7B-v0.3以0.9387位居榜首
  5. 05由于数据集中仇恨言论只占约18%,研究采用了类别加权(代价敏感学习)方法来缓解数据不平衡问题
这是 METAL MEDIA 制作的解读图,并非论文作者提供的原图。

他们做了什么

  1. 使用包含超过7.2万条罗马乌尔都语社交媒体评论的PURUTT数据集,其中约18%被标注为仇恨性内容
  2. 在零样本(不做任何训练)和LoRA微调(只训练约700万个参数,并用4比特量化技术节省显存)两种条件下对六个Transformer模型进行比较
  3. 零样本模型普遍容易把正常评论误判为仇恨言论,不同模型的F1分数在0.15到0.56之间波动
  4. 经过LoRA微调后,所有模型的F1分数提升到0.75至0.94之间,其中Mistral-7B-v0.3以0.9387位居榜首
  5. 由于数据集中仇恨言论只占约18%,研究采用了类别加权(代价敏感学习)方法来缓解数据不平衡问题

为什么重要

这项研究为缺乏大规模标注数据、也无力承担全模型重新训练成本的语言提供了一条切实可行的仇恨言论检测路径。它表明轻量级微调而非海量算力投入,可能是罗马乌尔都语乃至其他资源匮乏语言实现内容审核落地的更现实方案。

本文术语

  • 低资源语言 · 标注数据或自然语言处理工具稀缺,导致AI模型难以有效处理的语言
  • 零样本推理 · 不对模型做任何额外训练,直接用预训练模型完成新任务的方式
  • LoRA(低秩适应) · 冻结模型原有权重,只训练新增的小型矩阵,从而降低微调成本的技术
  • 参数高效微调(PEFT) · 只更新模型一小部分参数而非整个模型,用较少资源使大模型适配特定任务的方法
  • F1分数 · 综合精确率和召回率的评价指标,在类别数量不均衡时尤其有用
  • 4比特NF4量化 · 将模型内部数值压缩为4比特格式,以减少训练和推理时显存占用的技术

论文原文摘要(英文)

It is challenging to detect hate speech in Low Resource Languages (LRLs) because of the absence of annotated data, the informality of its language structure, and the lack of standardized grammar. A good example of such a challenge is Roman Urdu which is broadly used by South Asians on social media and has a high variation while lacking contextually consistent spellings. The objective of this paper is to conduct a comprehensive assessment of Large Language Models (LLMs) for Hate Speech Detection (HSD) in Roman Urdu script and fine-tune these models using the Parameter-Efficient Fine-Tuning (PEFT) method called Low-Rank Adaptation (LoRA). To evaluate zero-shot inference, we benchmarked it against PEFT on different transformer models, including Mistral, LLaMA, Falcon, and multilingual BERT. Experiments are conducted on the PURUTT (Parallel Urdu and Roman Urdu Corpus for Toxic Comments and Transliteration) dataset with over 72,000 annotated comments. The results suggest that zero shot models perform moderately (F1 = 0.56), but updating a small fraction of the model trainable parameters improves the classification performance significantly (F1 > 0.93). Our results have shown that PEFT delivers outstanding performance alongside excellent computational efficiency, making it highly suitable for low-resource language processing tasks.

作者 · Toneema Zubair, Muhammad Junaid Asif, Faisal Kamiran, Hafiz Hassan Saeed, Rana Fayyaz Ahmad

在 arXiv 阅读

最新论文

全部论文 →

METAL MEDIA 最新报道