Pedestrian Archetypes Extension -- More Pedestrian Models for Autonomous Vehicle Safety Testing
自动驾驶汽车需要留意的危险行人类型又增加了7种
作者此前的研究把危险行人行为归纳成12种行人原型,但持续标注YouTube行车记录仪视频后,又发现7种原有分类无法解释的重复行为模式。这篇预印本定义了这7种新原型,包括制造假事故骗保的骗子、不熟悉当地交规的外国人、为拍摄占用道路的网红、抗议者、情绪激动对抗司机的行人、靠轮子移动的伪行人,以及路边小贩,并配有视频画面作为证据。每种原型的必要行为和可选行为都是从标注数据中统计得出的。
METAL MEDIA 解读图
行人原型体系的扩展过程
证据状态实测结果与计划中的工作并存
- 原有12种原型此前Pedestrian Archetypes研究定义的12种危险行人类型,如漫游者、醉汉、分心者
- 重新标注行车记录仪视频持续用PedAnalyze行为标签体系标注YouTube行车记录仪视频,并与原有原型对照
- 发现新模式识别出7种原有12种原型无法解释的重复行为组合
- 提炼必要/可选行为样本占比40%以上定为必要行为,10%至39%定为可选行为,采用统计化标准
- 提出7种新原型骗子、外国人、网红、抗议者、对抗型行人、伪行人、路边小贩,均配有视频证据
他们做了什么
- 作者持续标注YouTube行车记录仪拍摄的行人-车辆危险互动视频,发现了7种原有12种行人原型(如漫游者、醉汉、分心者等)无法解释的重复行为模式。
- 分类过程分四步:先用PedAnalyze行为标签体系标注行人行为,再与原有12种原型对比确认是否为真正的新模式,然后挑选代表性视频并提取关键帧,最后从标注数据中提炼各原型的必要和可选行为标签。
- 某行为若出现在该原型至少40%的样本中,被归为必要行为;出现在10%到39%的样本中,则归为可选行为,以此建立数据驱动的分类标准。
- 新提出的7种原型是:骗子(Con Artist,制造碰撞骗保)、外国人(Foreigner,因不熟悉当地交通文化而误判)、网红(Influencer,为拍视频占用车道)、抗议者(Protester)、对抗型行人(Confronted,情绪激动、有攻击性)、伪行人(Pseudo Pedestrian,靠滑板、轮椅等轮式工具快速移动)和路边小贩(Street Vendor)。
- 每种原型都配有真实行车记录仪画面作为例证,如伪造事故、威尼斯三岔路口困惑的游客、纽约圣诞节街头拍摄、卡车故意撞向抗议者等,并在表I至表VII中列出各自的必要/可选行为。
![Fig. 1: Pedestrian from [2] stages an accident with friend.](https://media.metallab.ai/papers/2607.16922/f0.png)
| Essential Behaviors | Optional Behaviors |
|---|---|
| • Collision • Looking • Fall • Not-Cross • Run into traffic • Cross without crosswalk | • Climbing onto carhood • Thrown-back • Ignore traffic |

| Essential Behaviors | Optional Behaviors |
|---|---|
| • Ignore traffic • Near-miss • Cross without crosswalk • Run into traffic • Not looking/glancing | • Retreat • Back-turned • Collision |

| Essential Behaviors | Optional Behaviors |
|---|---|
| • Ignore traffic • Gesturing • Glancing |

| Essential Behaviors | Optional Behaviors |
|---|---|
| • Frozen • Not-cross • Looking • Ignore-traffic • Agitated | • Group-walk • Along-lane • Back-turned |
![Fig. 2: Confused Venice tourist unsure what to do. [4]](https://media.metallab.ai/papers/2607.16922/f4.png)
| Essential Behaviors | Optional Behaviors |
|---|---|
| • Agitated • Aggression • Cross • Ignore traffic | • Assault • Gesturing • Near-miss |

| Essential Behaviors | Optional Behaviors |
|---|---|
| • Ignore traffic • Run into traffic • Cross • Collision • Not looking/glancing | • Along-lane • Swerve • Pop-out-occlusion |
![Fig. 3: Influencer with dog as photographer lies down [7].](https://media.metallab.ai/papers/2607.16922/f6.png)
| Essential Behaviors | Optional Behaviors |
|---|---|
| • Pause-start • Pickup-object • Cross-on-red |
![Fig. 4: A group of pedestrians from [9] blocks the road as a vehicle passes through. One pedestrian is hit and remains in the path, causing a second collision.](https://media.metallab.ai/papers/2607.16922/f7.png)
研究结果
- 通过持续标注YouTube行车记录仪视频,观察到7种原有12种原型无法解释的重复行人行为模式。
- 从标注数据集中为每个新原型统计出了必要行为(出现于40%以上样本)和可选行为(出现于10%至39%样本)。
- 每个新原型都用真实行车记录仪画面举例说明,包括伪造骗保事故、困惑的游客、路边拍摄、卡车撞击抗议者、情绪激动的母亲、滑板者摔倒、路边小贩靠近车辆等场景。

可应用场景
- 可为自动驾驶安全测试仿真中设计罕见且难以预测的行人场景提供参考。
- 可作为行人行为标注工作中,在单一行为标签之上增加的更高层级分类框架。
- 可用作按原型收集行人-车辆危险互动代表性案例的组织方式。

局限与待验证事项
- 研究仅基于YouTube上的行车记录仪视频,文中未给出样本规模、地域或文化偏差方面的量化讨论。
- 支撑40%必要行为、10%至39%可选行为这一阈值的具体样本数量在正文中未给出。
- 目前尚未报告将这些新原型实际应用于自动驾驶安全测试或仿真中的验证结果。
- 该文为预印本,尚未经过同行评审形成正式定稿。

为什么重要
自动驾驶汽车的安全测试不仅要应对遵守规则的行人,还要为罕见、不可预测且危险的行为做准备,这项研究系统地为这类行为命名和定义,便于用在标注、仿真和评估中。相比单一行为标签,原型这种更高层次的概念能补充说明行人为何后退或为何做出难以预测的举动,而不仅仅是记录他们做了什么。
![Fig. 5: A hostile mother [3] as she crosses with children.](https://media.metallab.ai/papers/2607.16922/f11.png)
本文术语
- 行人原型(Pedestrian Archetype) · 一组共同出现的行为,用来识别某种特定类型的行人
- PedAnalyze · 作者此前提出的行人行为本体论和标准化标签体系
- 必要行为/可选行为 · 在该原型样本中出现比例达40%以上为必要行为,10%到39%为可选行为
- 行车记录仪视频 · 安装在车辆上的摄像头拍摄的视频,是本研究的主要观测数据来源
论文原文摘要(英文)
In our prior work, Pedestrian Archetypes, we defined pedestrian archetypes as collections of behaviors that uniquely identify a specific type of pedestrian. The first paper proposed 12 pedestrian archetypes, including the Wanderer, Drunk, Distracted, Flash, Indecisive, Blind, Flock, Jaywalker, Elderly, Kid, Eventful, and Parked Pedestrian. These archetypes were introduced to move beyond single behavior labels and provide a more natural way to describe how dangerous pedestrians actually behave pr
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调
METAL MEDIA 最新报道
图片来源: Taorui Huang et al., arXiv:2607.16922, cc-by-nc-sa-4.0