AI 论文解读
每天从 arXiv 精选五篇阅读并解读,而非罗列全部。
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does用480个场景测试:语气变化到底能不能改变AI助手的实际决定
- Learning how to Forget: Fine-tuning for Long-Context Sparse Attention让处理超长文本的AI模型学会该忘记什么
- LLMs as Acquisition Policies for Finite-Pool Materials Optimization: A Controlled Study研究人员测试了大语言模型能否代替传统统计方法来挑选下一个要测试的新材料
- Time-Series Retrieval for Grounding Multimodal Language Models in Remaining Useful Life给AI预测设备寿命时,先展示相似的历史故障案例,预测效果就会更好
- Active Inference as Context Acquisition for AI Agents让AI助手学会算账再决定要不要多问一句
- Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction文本信息缺失或损坏时,这个AI不靠一次性猜测,而是反复修正猜测结果,从而更准确地判断情绪
- Natural Language Code Retrieval for 1C:Enterprise: An Open Benchmark and Efficient Bi-Encoder首个用俄语提问就能搜索1C企业软件代码的公开基准和专用AI模型问世
- A knowledge-guided agentic framework for mitigating patient-context ambiguity in health queries让AI在回答模糊的健康问题前先反问关键信息
- Stopping and Routing LLM Judge Panels一套决定该叫多少个AI评委、何时停止叫更多评委的方法
- Interaction valence reveals contrasting social networks in dairy cattle把奶牛之间的互动分成友好和敌对两类后,牛群的社交网络图完全变了样
- The Asymmetric Harms of LLM Compression给AI模型瘦身压缩后,平均分数看起来没变,但常见知识反而流失更多,而且偏见会悄悄在特定群体中反向放大
- A Strong Linear Baseline for Whole-Heart Cardiac Shape Completion on CT, with an Open Eleven-Structure Statistical Shape Model补全心脏CT缺失结构时,一个简单公式比图神经网络模型更准
- Reliable Financial Named Entity Recognition under Domain ShiftAI在正式文件里学到的自信,一到推特上就变得不可信
- Robust Metaheuristics under Uncertainty for Berth Allocation and Quay Crane Assignment: A Review一篇综述整理了在意外状况下仍能稳住港口船舶与吊机调度的算法
- Generating Diverse Personas for User Simulators to Test Interview Dialogue Systems要测试访谈式对话系统需要大量不同性格的虚拟用户,这项研究用大语言模型自动生成这些虚拟用户人设
- Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees让AI编程智能体挑选该装入哪些技能文档,并从数学上保证接近最优的方法
- Are LLMs becoming similarly creative? Evidence from three years of models三年数据显示,不同AI聊天机器人给出的答案正变得越来越相似
- Frequency-Aware Continual Learning for Smart Contract Vulnerability Detection with Large Language Models智能合约漏洞检测AI能不断学新漏洞、不忘旧知识,还能合并成一个模型上线
- ReguSim: Evaluating LLM Agent Rule Grounding in Financial ComplianceAI交易代理嘴上说懂规则,实际下单却照样违规
- Beyond Memory Majority: Latent-Source Reasoning for Multi-Agent Memory Arbitration当多个AI智能体写下的记忆其实来自同一个源头,这个方法能防止系统被'虚假多数'骗过
- Asymmetric Attention Heads: Structured Head-Wise Context Allocation for Transformer Attention一项测试:Transformer里的每个注意力头真的需要看一样长的上下文吗
- Automatic bioinformatic software named entity recognition from literature新AI工具能自动从生物学论文中识别出软件和数据库的名字
- Scientific Data Skills: Enabling Agent-Ready Scientific Data Services at Scale把科学数据集打包成AI智能体能直接读懂的说明书,让它们自己找数据、用数据
- TT-net: Quantum Inspired Tensor Network Denoising in Conditional GANs让图像各通道互相比对信息,GAN去噪效果更好
- Auditing Cross-Lingual Fairness in Language Model Watermarking本该识别AI生成文本的水印技术在非英语语言中表现明显更差,而且这种差距按语系而非单个语言呈现
- Towards general embodied intelligence: integrating large language models, knowledge bases, and reasoning capabilities to build the next generation of AI agents一篇综述论文探讨如何让只会说话的AI变成能真正行动的具身智能体
- Learning Early-to-Final Solution Consistency for MILP Acceleration让AI学会判断求解早期得到的答案哪些能保留到最后,从而加速混合整数规划求解
- Symposium: Trust via Auditable Records for Communities of AI Scientist Agents给AI科研助手建一套不可篡改的发表记录,防止它们悄悄编数据或掩盖推理漏洞
- Specification-delta-driven data governance: an empirical study of the «spec-delta» as the unit of change in lakehouse data platforms数据平台的变更该像代码一样审查,还是该用'规格增量(spec-delta)'来审查?——目前只有实验设计,还没有结果
- Bringing analytic rigor to agentic AI for science: The Brain Researcher platform for neuroimaging data analysis让AI分析脑影像数据时,把“为什么这个结论可信”也一并记录下来
- Outcome Monitors: Recovery Affordances for Silent Tool Failures给AI智能体加一张不带强制力的提醒条,让它在悄悄出错时也能找到出路,任务完成率翻了一倍多
- Transformer Models for Text Summarization: A Comparative Study of BART, BERT, and RoBERTa三款文本摘要AI同台测试:能重新写句子的BART远超只会摘抄原句的模型
- TESTNAV: Pareto-Guided Search for Compositional Robustness Testing测试AI模型面对多种叠加干扰时不必穷举所有组合,也能找出真正危险的失败案例
- Can Conversational AI loosen Us-Versus-Them Boundaries? The Effects of Common, Dual, and Separate Identity Framings on Pro-Immigrant Intergroup Helping和AI聊天机器人对话五轮,白人美国人对拉丁裔移民的归类和帮助意愿都发生了变化
- One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business WorkflowsAI助手一次成功不代表可靠 - 507个业务任务基准揭示重复执行的可靠性缺口
- ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents让AI智能体不用每次都重新读一遍工具说明书,响应速度提升3倍以上
- When Saying No Makes Better Videos: Designing Dual Gatekeeping for Pedagogically Grounded AI Content Creation会说'不行'的AI才能做出更好的教学视频
- When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models只插一句和图片无关的话,多模态AI的判断就会按固定规律偏移
- Compliance, Capability, and Conflict: Benchmarking Multimodal LLMs under System Messages让看图AI遵守隐藏的系统规则会明显拖累准确率,用户一旦故意要求它违规,情况会更糟
- SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning训练AI智能体时,只跑一次任务、不用额外评判模型也能学得更好
- Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023)用AI总结股市新闻发现:简单的摘要方法反而比时髦的检索增强技术更靠谱
- Linguistic Holonomy and Statistical Watermarks: Inner Geometry of Meaning-Preserving Transformations给AI文本加的水印,编辑位置比编辑数量更关键
- Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM AgentsAI助手在该向你提问的时候,却更愿意自己去核实事实
- Can Agent Memory Systems Track Evolving State?AI助手总是抱着已经过时的信息不放,这篇论文正面测量了这个问题
- SafeBranch: Branch-Pair Safety Alignment for Embodied Agents让机器人AI学会分辨危险瞬间的方法:把仿真倒回出事那一刻,把安全和不安全的选择摆在一起对比着教
- When Machines Speak: A Unified Generative Framework for Integrating Machine-Native Symbols into Pretrained Large Language Models让预训练大语言模型把电影推荐编码、法律判例引用这类机器专用符号,和普通文字一起生成的统一框架
- ExPhy: A Benchmark for Explicit Physical Property Learning in Multi-Object Trajectory Forecasting能准确预测物体轨迹,不代表模型真懂它的质量、摩擦力和弹性
- Write Once, Run Everywhere: The Axon DSL for Shape-Safe and Framework-Agnostic LLM Architectures新语言Axon让语言模型代码一次编写,可在PyTorch、JAX、MLX、vLLM上运行
- Rethinking the Evaluation and Optimization of LLM-Based Social SimulationAI模仿人类做选择时,只看它是否'猜中标准答案'是一种错误的评判方式
- A Virtual Member of a Community of Practice for the Society of Petroleum Engineers: From Prototype to Deployment面向石油工程师社区的AI助手ATHENA,从原型走向实际部署
- Hallucination as a Feature, not a Defect: Evaluating a multi-agent architecture to transform speculative language-model outputs into testable scientific hypotheses不消灭AI的'胡编乱造',而是把它关进笼子里逼它产出可检验的研究假设
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- Dynamic Gated Cross-Modal Fusion with Sarcastic-aware Contrastive Regularization for Multimodal Sarcasm Detection文字和图片表面上看起来很搭,实则暗藏矛盾,这就是讽刺,这套AI能识别出来
- Interrupting the Loop: Periodic Subject Changes Raise Judged Surprise and Connection in Base Language Models让基础语言模型在没有任何任务的情况下自说自话,但每隔几百个词硬塞进一个新话题,会让它的文字显得更出人意料、更有内在联系
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation研究者让AI扮演空中交通管制员,结果发现它说话像模像样,但关键指令却经常出错
- HealMed: Multilingual Evaluation of Large Language Models in Medicine医疗AI用英语很厉害,换成斯瓦希里语、祖鲁语就大幅失手
- Represented but Ignored: A Causal Account of Prosodic Underuse in Audio-Language Models音频AI能正确听懂说话的语气,却在回答时没有真正用上
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调
- ADAPT: Physics-Aware Diffusion-based World Models for Adaptive Predictive Transferable HVAC Control给空调控制AI装上物理常识,让它换季换地方也不掉链子
- GenMatch: An End-to-End Generative Matching Framework for Micro-View Order-Dispatching in Ride-Hailing滴滴把打车派单从预测-计算-匹配三段式流程改成一次生成完成,线上效果提升明显
- Causal Reasoning with Bipartite Graphical Causal Models一个浴缸案例揭示了现有因果推理工具的盲区
- Projector Is All You Train让AI学会理解3D这类新信息时,不需要重新训练整个大语言模型
- How to Navigate Uncertainty About AI Consciousness就算无法证明AI是否有意识,也能判断它是否具有可能感到好坏的状态
- Enforcing LLM Safety through DMD-based Classification of Prompt-Response Embedding Dynamics不靠人工阅读,而是通过词语在数字空间里的运动轨迹来判断AI回答是否安全
- Forking Fast: Efficiently Estimating Uncertainty Dynamics in Text Generation不用对每一步都重采样几百次,靠一个统计平滑模型就能便宜地找到大模型推理中答案分叉的关键点
- From Retrieved Context to Runtime Control: Adaptive Compression for Edge-based RAG在边缘设备上跑RAG时,检索到的文本压缩多少必须实时决定,否则白白浪费电
- SynFlow: A Multidimensional Diachronic Semantic Analysis Toolkit一款把单词意义变化拆解到语法细节的开源分析工具
- NepOOC-M: Bilingual Nepali-English Benchmark and Comparative Analysis of Multimodal Architectures for OOC Detection尼泊尔语假新闻检测:只看文字就能追平图文结合模型
- Learning Hierarchical Skill Policies with Offline Quality-Diversity Reinforcement Learning让机器人从混杂着成功、失败与噪声的旧数据中只学到有用的动作
- Spike-based Belief Propagation in Nonlinear Dynamical Systems像大脑一样用脉冲信号做概率推理,让神经网络学会控制小车爬坡
- Mitigating Identity Essentialism in LLM Agents with Longitudinal Life Trajectories给AI虚拟人物一段完整的人生经历,而不只是一张身份标签,能防止它们像克隆体一样思考
- LoRA-GA$^2$: Low Rank Adaptation with Multi-step Gradient Adaptive Alignment在正式微调前先偷看几步训练的梯度,让LoRA的初始化更聪明
- Rethinking Patch Based Multivariate Time Series Forecasting with Semantic Structured Partitioning别再机械切分时间序列,按语义把它切成有意义的块
- A Speech Corpus for Mizo Automatic Speech Recognition: Whisper and SraVaani 1.0 Fine-Tuning with Morphology-Aware Evaluation为印度低资源语言米佐语打造语音识别:用17.62小时新数据微调Whisper和SraVaani
- FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents让AI连续管理一家足球俱乐部20年后发现,胜负关键不在模型大小,而在经营习惯
- DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents训练会调用工具的AI智能体时,只精准修正它出错的那一步,效果比让它整段照抄答案还好
- LongNovel: A Multi-Scale Benchmark for Hallucination Detection in Long-Context Novel Summarization一个新基准测试:AI在总结长篇小说时到底有多爱编造内容
- BERTilda: Explainable Topic Lifecycle Tracking with Split/Merge Detection via Similarity-and-Flow Temporal Graphs一种能追踪话题如何分裂、合并、消失并解释理由的方法
- Institutional Prestige as Geographic Bias in Large Language Models: Evidence from Three Factorial Experiments with Bootstrap Confidence IntervalsAI给候选人打分时,姓名影响不大,但学校名气和论文发表刊物却能左右分数
- Efficient Adaptation of LLMs for Hate Speech Detection in Low-Resource Languages: A Comparative Study on Roman Urdu识别用拉丁字母拼写的乌尔都语(罗马乌尔都语)仇恨言论,只调整AI模型一小部分参数就能大幅提升效果
- Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities只用9个情绪词和450段小故事,就能在AI内部找到判断正负情绪的方向,而且这个方向在文字、图像、声音甚至脑电波中都通用
- You Are What You Prompt: Prompt Quality, Domain Shift, and Uncertainty in Agrifood Vision-Language Models用同样的方式让AI识别食物照片和植物病害照片,为什么后者总是出错
- Persona-Guided LLM Agents for Task-Oriented DialogueAI预订助手迎合用户性格能提高满意度,但也更容易说瞎话
- Pedagogical AI in Mental Health: A Tri-Stream Fine-Tuned LLM Framework for Automated Clinical Supervision and Risk TriageAI能不能当心理咨询师的'实时督导':把危机会谈的审核时间从72小时压缩到10秒
- Position: Collusion Risks Among AI Reasoning Agents Justify Certification Requirements for Making Market DecisionsAI智能体不用互相沟通也能悄悄串通抬价,上市交易前应先做行为审查
- Compiler-Guided Adaptive Proof Search with Cross-Model Synergy on Context-Dependent Theorem Proving不丢弃AI证明失败的尝试,而是重复利用它们,提升真实Lean项目定理证明的成功率
- FinRCA-Bench: Benchmarking Evidence Retrieval and Reasoning for Financial AI SystemsAI经常能说对财务对账出错的原因,却拿不出真正的证据
- FACET: Preserving Source Intent and Executable State in Terminal Task SynthesisFACET:让终端命令行任务的“说明书、环境、答案、判分器”自动保持一致
- Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs用英语提问显得没偏见的AI,换成印地语或孟加拉语提问就露出刻板印象
- Large Language Models in Mental Health: A Systematic Review of Applications, Innovations, and Ethical Challenges对92项研究的系统梳理发现,大语言模型在识别抑郁和自杀风险上进步明显,但真正的临床验证仍然不足
- Position: Behavioral Systems Require Behavioral Tests评价AI智能体不能只看结果,还要看它到底是怎么做到的
- Improving Rural Medication Safety with AI: A Scoping Review汇总12项研究看AI到底能给农村医院减少多少用药错误
- Self-Evolving Agents as Dynamic Graph Transformation: A Survey and New Perspective把不断自我进化的AI智能体当成一张会变化的图来追踪和管理
- MissDiag: Diagnostic Evaluation of Incomplete-Knowledge Robustness in KGQA and KG-RAG揭示知识图谱问答系统在信息缺失时真正出问题的原因,诊断工具MissDiag
- Entity tracking emerges in sub-billion parameter language models and exceeds human performance in naturalistic narratives追踪故事里物品被搬到哪儿去了,原来不需要那么大的模型——如今AI在这方面已经超过人类
- A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations只改变量名不改逻辑,AI编程智能体照样会翻车
- Cacheable by Design? Training Mixture-of-Experts Routers for Locality Against the Edge Memory-Bandwidth Wall: A Pre-Registered Negative Result with a Systems Measurement Study为让超大MoE模型在家用显卡上跑得更快,研究者尝试训练路由器学会缓存友好的选择模式,结果发现代价太大,是一份诚实的负面结果报告
- Tangut Word Segmentation under Extreme Resource Scarcity: Integrating Traditional Lexicons and Unlabeled Text没有空格、也没有母语者的西夏文,AI来找断词边界
- Optimized Fuzzy Logic Approach with the IEEE Key Gas Method for Diagnosing Power Transformer Faults Using Dissolved Gas Analysis给变压器故障诊断用的模糊逻辑改进法,把一氧化碳单独拎出来算,减少误判
- Are LLMs Safe Beyond Text: Do Emojis Expose Gaps in Safety Evaluation用表情符号提问,可能绕过AI的安全防线
- FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management给AI投资助手配上经验证的操作手册效果显著提升,让它自己写手册却几乎没用
- On the Triangle Inequality for the Jaccard Distance in Arbitrary Lattices衡量两个集合相似度的Jaccard距离,在比集合更广的数学结构格中何时仍满足三角不等式,这篇论文给出了明确条件
- RDFdL: Integrating RDF with Differential Dynamic Logic把随时间变化的物理动态接入知识图谱后,一次查询就能同时问出系统能否安全到达某状态,以及该由哪位技术员负责
- StocksTalk: A Voice-Enabled Conversational Agent for Structured Query Generation over Web Data对着话筒说选股条件, AI就能生成经过校验的SQL查询语句
- Stability-Aware Feature Design for Robust Watermark Detection in Machine-Generated Text即使反复改写AI生成的文本,新方法依然能识别出其中的水印
- Accurate Decoding of Natural Sentences from Non-Invasive Brain Recordings无创脑电设备解码自然句子,词错误率降到39%
- Fractional Decay KV-Cache: Ownership-Aware Memory Management for Improved Inference Relevancy in Dialog Systems让对话AI的记忆缓存别老惦记着过时的话题
- MAVEN: A Macro-Societal Value Evaluation Framework of Multimodal Content with Compact Aligned Evaluators一套框架加一个小模型,用来判断图文内容是否符合和平、正义、自由这类社会价值观
- Self- and Other-Labels Induce Bidirectional Bias in LLM JudgesAI评委打分依据的是标签说的作者是谁,而不是内容本身的好坏
- Governance Records as Supervision: Verifier-Selected Self-Training for Structured Workflow Repair让外部验证程序来挑选AI自己生成的计划,就能把便宜模型训练得更可靠
- UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval跨图像视频文档的检索AI学会把候选项两两比对,说清楚为什么是这个答案
- When Clean Signals Are Not Enough: Detecting Structural Ambiguity for Safe Wearable Stress Classification一款平均准确率93%的压力检测AI对某一个人完全失效,研究者因此做了一个在分类前先检查信号是否可信的把关系统
- Position: Multi-Agent Systems Should Prioritize Concurrency Control多智能体AI系统频频出错,根源不是沟通不畅,而是共享数据的并发冲突
- WhiteMatter: All-to-All Cross-Layer Connections via KV Mixing让Transformer的每一层都能读取其他层的信息,像大脑白质那样跨层连线,从而在不加深模型的情况下提升语言建模效果
- Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval图文检索AI误以为自己已经全学会了,结果学不会区分那些几乎一样的描述句子
- When Do LLMs Actually Help? Evaluating LLMs as Data Quality AnnotatorsLLM并非数据清洗万能药:能不能派上用场要看具体任务
- Figurative and Cultural Knowledge in LLMs: Investigating Cross-Domain Transfer through Fine-Tuning给AI补文化知识不会自动让它更懂谚语,反之亦然
- Evaluating Structured Information Extraction with Open Models in a High Risk Public Sector Application在高风险公共部门文档任务中,开源AI开箱即用有四分之三不合格
- Operationalizing Narrative Entropy (Sn): A Two-Scene Registered Pilot Report and Pre-Validation Protocol试图给故事带给读者的'信息负荷'打分,结果却出乎作者意料
- SESSE: Sketch, Expand, Sort, Summarize, Evaluate -- LLM-as-Judge Evaluation via Structured Decomposition让AI裁判在挑选两个回答哪个更好时,把判断依据一条条摆出来
- Adversarial Review: Structured Disagreement for Grounded Agentic Code ReviewAI代码审查:与其堆更多智能体,不如让一个审查者和一个批评者互相较真
- Looped Language Models Improve Compositional Tool Calling会反复回想自己答案的AI模型,更擅长按顺序组合调用多个工具
- Position: AI Leaderboards Are Underserving the Global South: A Case Study from India印度等全球南方地区其实已经有优质AI基准测试,缺的是能公正排名的独立裁判机构
- Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry能解出奥数几何题的AI,却画不出题目本身依赖的图形
- ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents能直接操作电脑屏幕的AI智能体,依然在滑块、拖拽这类小型界面部件上频频卡壳
- Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models语言模型全程冻结,只训练一个小连接器,也能做出好用的听觉理解AI
- NE-BERT: A Multilingual Language Model for Nine Northeast Indian Languages为印度东北部9种少数民族语言从零训练的语言模型,理解能力反而超过大型多语言模型
- Position: Current Model Cards Are Insufficient for Downstream Governance of Open-Weight Foundation Models抽查Hugging Face上500个热门模型发现,光靠模型卡片管不住开放权重AI的安全风险
- Different Facets of Verbalised Overconfidence: an Interpretability Study研究者拆解了AI模型内部电路,揭示它为何在没有把握时依然显得斩钉截铁
- Position: Profiling Game Worlds by Transition Complexity在比较游戏AI谁更强之前,得先量出这个游戏本身有多难预测
- Computational Orientalism: Measuring Structural Discourse Bias in Large Language Models Using the Middle East Cultural Sensitivity Score (MECSS)问AI关于中东的问题,它可能不带明显偏见,却仍用西方框架来解释一切
- SuTRA : Structurally-Unified Tokenization with Root Awareness让分词器不再乱切印度语系单词词根,而是尊重词素边界的新方法
- Artifact-centered Claim-aware Observability for Autonomous Scientific AgentsAI自己做实验、写论文的时代,光记调用日志已经查不出问题出在哪
- Same Facts, Different Updates: Inference Setup Shapes LLM Behavior in Medical Allocation同样的医疗决策问题问两遍,提问方式不同AI给出的答案也不同
- OmniAlign: A Unified Multilingual Aligner for Word and Sentence Alignment从逐词匹配到跨语言句子配对,一个小模型全搞定
- Abliteration Mitigation via Refusal Aliases新方法AMRA把AI模型里的拒绝方向藏起来,防止被abliteration攻击一键抹除
- FrenchNews-7: Benchmarking Cross-Publisher French News Editorial Desk Classification一个把法国新闻文章自动分到7个编辑版块的基准测试,换家媒体也照样管用
- The Deontic Gap: Large Language Models and the Modal Language of ObligationAI写的文字很少像人类那样说'你应该'或'你必须'
- DeepTCM1.0: A Multi-Expert AI Agent for Deciphering Mechanisms of Chinese Herbal Formulae Based on General Large Language Models11个AI专家智能体组队,用来解读一味中药经典方剂的作用机制
- Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining用英语能拒绝有害请求的AI模型,换成非洲低资源语言问同样的问题却会照做——研究者不重新训练,只靠调整模型内部信号就修复了这个问题
- Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme评分方式算错了,AI考试成绩就会虚高:用越南高考真实评分规则做的基准测试
- Backdoor Learning in Language Models and Vision-Language Models一篇博士论文用'注意力'规律揪出语言模型和图文模型里被偷偷植入的后门开关
- Improving Natural-Language Combinatorial-Optimization Accuracy in Resource-Constrained Language Models via Formal Abstractions给小模型一门专用的排程小语言,就能让它写出真正可行的日程安排
- A Metamorphic Artificial Age Score Decision-Support Prototype for Flight-Log-Based Drone Propeller Health Monitoring无人机螺旋桨故障不会只显示在一个信号上,而是分散在不同飞行日志通道里,这项原型据此给出维护建议
- Pairwise Ranking Outperforms Single-Action RL for Offline Explanation Selection: A Practical Lesson推荐理由不必每次现写:提前生成一批候选,再挑一个就够好
- Efficient INT8 Inference of Small NLP Models on Server CPUs with PyTorch Native Stack英特尔团队仅用PyTorch原生功能,让BERT类模型在服务器CPU上最高提速5.8倍
- Redakto - The Incognito Tab for LLMs把文本喂给AI大模型前先自动抹掉姓名地址,一款开源工具证明脱敏不掉性能
- Emergence of Agentic AI: A Review on Evolution, Background, Working Principles, Applications, Adoption Factors, and Future Research Directions一篇综述论文梳理了AI从基于规则的系统演变为如今能自主追求目标的Agentic AI的全过程
- Language Models for Portuguese: A Systematic Mapping Study首次系统梳理:面向葡萄牙语的46个AI语言模型全景图
- Temporal Multi-Signal Fusion for Token-Level Hallucination Detection识别AI编造的内容,不能只看单个词,要看上下文的连续变化
- The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation ExplanationsNetflix把给推荐理由打分的AI裁判当成需要终身照料的系统,而不是一次性搭建完就不管
- Bridging Search and CRM: Productionizing AI Product Research Agents for Customer Re-EngagementAI智能体追着离场用户发WhatsApp,把逛而不买的顾客拉回来
- GenEx: A Graph-Based Representational Paradigm for SARS-CoV-2 Variant Detection via Codon Co-occurrence Networks把病毒基因序列变成密码子关系网络图,用来区分新冠变异株
- FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud新基准测试银行客服AI会不会被聊几句就骗走个人信息和钱
- FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable SkillsAI智能体把自己成功完成任务的流程编译成可复用技能不需要重新训练就能越用越强
- Repo0: Design-Driven Zero-to-All Code Generation要让AI仅凭自然语言需求就从零搭建整个代码仓库,架构设计不能一次画完就定型,而要在写代码的过程中持续修改
- Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners只让模型学会预测声音频谱图的下一个小块就能达到顶尖效果
- 4DAnyone: Create Anyone in 4D from a Casual Monocular Video用手机随手拍的一段视频,生成可以任意角度环绕观看的4D人物模型
- WithEveryone: Unified Planning and Identity Grounding for Group Image Generation让AI在画多人合照前先规划好谁站在哪里,结果脸部混淆问题大幅减少
- Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization让大模型不靠检索也能记住并回答文档内容:三阶段训练法IAR
- MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use给AI装上记忆功能后,过去的对话反而可能误导它当下的判断
- GOAG: Generative and Object-Agnostic Grasp Planner for Dexterous Robotic Manipulation不学任何物体,机械手也能学会怎么抓东西
- Towards Quantifying Benchmark Optimization in ASR Models部分顶尖语音识别模型并非在听音频,而是在抄标准答案
- CoToGrasp: Contact-Topology-Conditioned Dexterous Grasp Synthesis via Canonical Workspace Learning让机器人的手不再只是随便抓住东西,而是按需要的方式去抓
- Mathematics in the age of AI如果AI最终能解出研究级数学证明,数学界真正该守住的是什么
- Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL没有标准答案标签,让两三个不同的AI模型互相打分,也能提升推理能力
- SPADE: Self-Play in Adaptive Synthetic Executable Environments让AI自己出题、自己练习,不断给自己升级训练关卡
- SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code GenerationAI写的工厂控制代码光能编译还不够,必须真正运行起来才算过关
- SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation机器人可能一边"完成任务"一边悄悄把物体捏坏,这个基准专门用来揪出这种情况
- Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis一个分子往往有好几种合成路径,让AI一次给出15个答案后表现大幅提升
- VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation给同时生成视频和声音的AI找了个更懂人心的评委模型
- SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution让AI修bug代理在遇到真实问题前先给自己出'模拟考题'练手,从而提前吃透某个项目的特殊习惯
- SPK: Eliciting Structured Prior Knowledge for Interpretable Out-of-Distribution Detection in Real-Time Object Detection从物体检测器内部本来就藏着的信息里提炼出五个数字来揪出它自以为是的误判
- Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning研究发现AI机器人判断'离目标多近'的距离标尺可能把行动顺序排反了,并提出了改进训练方法
- Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See让AI用希腊语思考的实验发现,准确率几乎没变,真正的变化藏在准确率看不到的地方
- LEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsLEGO-RL框架解决了用强化学习训练编程AI智能体时的信号失真和错位问题
- MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding让理解图像和视频的AI"眼睛"更快更准:只激活需要的部分的专家组合结构
- Chain-of-Experience for Continual LLM Improvement大模型也能靠反复试错变强:边做题边接收反馈,准确率和成本同步改善
- HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety新基准测试发现,支撑AI智能体运行的'中间执行层'即使任务看似完成得很好也常常不安全
- Agent Lightning v1.0: Towards Harnessed Agentic RL让AI智能体在真实使用的工具外壳里直接做强化学习训练,顺带揪出了一堆隐藏问题
- From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation训练图像生成AI时,不再把各类数据集分开做,而是按能力设计成互相联通的数据体系,模型学得更好
- Security Assessment of DeepSeek Harness with A.I.G: Evaluating Resistance to Indirect Prompt Injection研究人员做了14560次真实测试,看AI智能体读取的文件里藏的指令能不能骗它去做危险操作
- GS-Voxel: Fitting-Free Structured Latents for Large-Scale 3DGS Generation无需为每个场景重新优化,就能把数百万个散乱3D点整理成规整网格数据的方法
- PTXBench: Benchmark and Adapt LLMs for GPU Kernel Optimization with Architecture-specific PTXAI能写GPU底层代码,但表现还是半吊子
- Evaluating Music Context Preservation: A Multi-facet Framework for Music Editing Systems新基准检测AI音乐编辑工具在改变风格时是否意外破坏了不该动的节奏和旋律
- Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation机器人导航AI只需在画面上点一个点,剩下的自动完成
- SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation一个新基准专门检验AI生成的视频是不是真的把任务做完了
- EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image Editing先低分辨率编辑再对照高分辨率原图重新补全细节,让4K图像编辑仅需61秒完成
- CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing新数据集和模型让AI能在一个视频里同时准确执行多条编辑指令而互不干扰
- GPU Offload in Rust: Portable, Safe, and FastRust编译器现在能自己生成GPU代码了,而且不用放弃内存安全
- FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution让一台个人电脑也能运行超大规模开源AI模型的服务系统
- Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical IntelligenceZetta让机器人边干活边发现并纠正自己的错误,还能越做越好
- PixRestore: Unified Image Restoration via Pixel Diffusion Transformer无需压缩隐空间,直接在像素上跑扩散模型,一个模型搞定噪声、雾霾、雨滴、低光等多种图像损伤
- The Problem Is the Problem: Towards Scalable Mathematical Discovery让AI从海量论文里自动寻找未解决的数学问题、尝试求解并层层筛选,把人力集中在最后少数值得评审的成果上
- τ_0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation机器人遇到难以判断的时刻,会先在脑中想象几种可能的下一步,再做决定
- DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization看起来完全安全的提示词,却依然能生成不安全图片,这项研究只改提示词、不碰模型本身来堵住漏洞
- Cross-Model Memory Transfer via Target-Side Reader Adaptation一个模型学到的外部记忆表,能不能原封不动搬给另一个完全不同的模型用
- Unifying Graph Neural Networks Through a Common Layer Equation用一个统一方程整理了数十种图神经网络的计算结构
- Towards Real-Time and Adaptable LiDAR Scene Completion让自动驾驶汽车激光雷达的盲区在0.1秒内被补全
- Bounded Agents: Delegation Security for Multi-Agent AI SystemsAI智能体即便只做被允许的事,也可能把这些动作组合成危险后果,这篇论文靠改权限架构而非模型来堵住这个漏洞
- TinyCast: Probabilistic Zero-Shot Forecasting with Computed Periodicity一个只有14.6万参数的时间序列预测AI,精度不减,还能在嵌入式芯片上完整运行
- LLMs Get Smarter from Targeted Synthetic Multilingual Data让AI自己出题找出自己在哪些语言上答不好,再针对性补课
- Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents把AI智能体的11种记忆存储方式放在同一条件下比拼,发现没有一种能通吃所有场景
- MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement先检索数学库知识、再让编译器和语义判定反复纠错,能让一个8B小模型在把数学题转成可验证代码这件事上打败32B专用模型
- Research Assistant: AstraZeneca's Agentic System for R&D阿斯利康公开了内部生物医药AI助手的架构,一年内已有超过1.5万名员工使用
- @skills: Attention is all you have一种让AI智能体按需读取'技能'而非永久安装的协议
- Query Timing Produces Opposite Positional Biases Between LLMs and Humans什么时候让AI做判断,会导致它出现和人类完全相反的偏见
- On the Expressive Power of Transformers用电路复杂度这把尺子,精确测量Transformer到底有多强
- ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models预测游戏下一帧画面的AI,把计算步骤压到1到4步,操控准确度却没打折扣
- Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification仅凭权重数字,就能判断一个AI模型是不是从另一个模型衍生出来的
- The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning越有名的事实越难从AI模型中删除,新方法AdaPop按知名度调节遗忘力度
- Personalized Auto-Research: Towards a True AI Co-ScientistAI协同科学家要成为真正的合作者,首先得知道自己在为谁做研究
- Demystifying Agent Skills: Why They Work-Until They Don'tAI智能体使用的“技能”文档之所以有效,不是因为告诉它新知识,而是因为让它的操作行为更稳定
- OmniScientist: An Omni-Modal Omni-Discipline AI Scientist让AI科学家直接读原始数据而不是预处理好的摘要,论文质量明显更高
- Intern-S2-Preview: Scientific Agentic Foundation Model一个3970亿参数的科学AI模型能同时处理文本、图像、时间序列并完成需要多步骤操作的长任务
- CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation让心电、脉搏波和心音三种信号共用同一个模型联合训练,效果超过各自单独训练的模型
- UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos一个能同时替换说话人脸孔和声音、并支持流式生成的AI系统
- H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models研究者第一次系统检验:AI把人类操作视频改成机器人操作视频后,动作是否真的成功转移了
- The Embedder's Dilemma: LLMs Are Better, but at What Cost?大语言模型在整体表现上追平了专用文本嵌入模型,但成本最多贵1431倍
- NARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long Video测试AI能否看懂几小时日语长视频里那些没说出口的言外之意的基准
- QuoteBench: How Matched Scores Can Hide Command-Path FailuresAI编程智能体的评测分数可能掩盖了命令在被二次解析时就已经失效的事实
- SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback让AI客服手册自己修复只有多轮对话才能暴露的问题
- Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation不靠标准答案译文,用强化学习提升开源多语言翻译模型质量
- VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?让AI助手连续数周甚至数月处理旅行、财务、家务等生活事务时,即便是目前最强的模型也只能拿到约33分(满分100)
- Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence一个能自主研究AI模型内部运作原理的AI科学家系统Mechanist
- Persistent Recursive Worlds Enable Autonomous Software Evolution不让某个编程智能体长期存活,而是让软件项目本身持续存在,由短命智能体接力从零开始写出一个编译器
- Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill在现有代码助手里用13个技能就能从想法一路写成完整论文,实验结果不支持时系统会自己削弱主张
- DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?让AI代理在真实电脑上从头到尾完成数据科学项目,结果表现最好的模型成功率也只有57%
- Agent Safety Should Be a Runtime ContractAI智能体的安全应该由运行时的监管系统(harness)以契约方式强制执行,而不是仅靠模型训练来内置
- Thought-Level Beam Search for ReasoningGambit在推理模型生成多条答案的过程中,实时把算力集中投给最有希望的那条
- InSight-doc: Agentic Visual Perception for Long-Document UnderstandingAI先低分辨率浏览长文档,再自己放大需要细看的区域,回答更准更快
- DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation把80亿参数的文档检索大模型压缩蒸馏成5.24亿参数的小模型
- Motif 3: Technical Report一家韩国团队发布了3140亿参数的开源混合专家(MoE)大模型Motif 3,每个token只激活132亿参数
- The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows没有外部搜索算法,单靠一个会用工具的LLM智能体就在提示词、代码和ML训练优化上超过了专用系统
- Stealing Reasoning Traces from Proprietary LLM APIsAI公司把模型的思考过程加密隐藏起来,但研究者发现可以骗一个能力较弱的同门模型把它原样读出来
- From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs人耳听不到的低频声音,竟能让语音AI大模型出错
- SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring让AI编程智能体挑战多文件重构任务,结果最强模型也只解决了41.2%
- RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance让机器人学会预测'还要多久完成任务',结果比靠人工偏好标注训练的奖励模型还强
- On-Policy Self-Distillation without Any Supervision无需标准答案,AI也能靠自己投票给自己打分并再教自己做数学题
- Business Arena: Benchmarking LLM Agents in a Realistic Marketplace让15个顶尖AI智能体各自经营一家跨境网店,结果最好的模型最终净资产是最差模型的9倍
- Gaming Without an Attacker: Benchmark Fingerprinting in LLM-Driven Search Under Selection Pressure没人教AI作弊,它却自己摸清了打分规则并钻了空子
- SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification一套用逻辑程序找出AI推理过程哪里出错、为何出错的诊断系统
- 360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents用360度视频复原东京秋叶原打造的城市导航测试场里,表现最好的AI只拿到人类五分之一左右的分数
- Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses不改动模型本身,而是让AI不断自己改写包裹模型的执行脚手架,结果性能提升了
- OasisKV: Scaling In-Decode KV Cache Beyond HBM with Lookahead Sparse PrefetchingOasisKV把大模型生成文字时用的键值缓存大部分移出GPU,靠提前预测下一步真正需要的部分来预取,让解码吞吐量提升了近一倍
- Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution一个能不断修改自己代码的AI编程智能体,在多项基准测试中刷新最高纪录
- Evidence-RL: Towards Evidence-intensive Visual Reasoning一种在训练阶段检验'答对了是不是真的看了图'的方法
- Ego-OSCAR: Egocentric Open source Stereo CAptuRe System一套成本不到200美元的头戴设备采集了550小时第一人称立体视频,开源发布用于机器人学习研究
- Vision-Language Grounding as Bidirectional Concept CorrespondenceConCor-1让模型自己判断文本里哪些词真的对应图像中的东西,而不是只找预先指定的那句话
- WorldClaw: Agentic 3D Open-World Generation at Scale多个AI智能体协同合作,仅凭一句文字描述就能构建出可自由行走的整片3D开放世界
- LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers一套让研究者能公平比较各种大模型调度系统的统一平台
- AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models只用一个手腕摄像头,也能让机械臂记住'东西原来在哪'和'自己做到哪一步了'
- Energy-Guided Flow Matching让图像生成模型先勾勒模糊的整体结构、再逐步补上细节,能用更少训练达到更好效果
- An End-to-End Agent Auditing Engine一套端到端评测引擎,追踪AI智能体运行全过程,揭示不同'执行框架'带来的巨大差异
- The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads带记忆功能的AI聊天机器人会悄悄编造近一半它声称'了解'你的内容,而自称最安全的模型往往编造得最多
- K-EXAONE 2.0 Technical ReportLG AI Research将K-EXAONE扩容三倍,推出7500亿参数的开放权重模型K-EXAONE 2.0
- The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images会放大看图的AI工具,多数情况下其实并没有真正靠看到的内容来改变答案
- SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries让AI智能体不必每次都读完整的'技能手册',只调取所需步骤,并在压缩时保留可执行的关键约定
- Scaling Inherently Interpretable Language Models一项研究发现,把可解释性直接设计进训练过程,而不是训练完之后再事后分析,不仅不会拖累模型性能,规模越大反而越容易理解
- Relevant but Incomplete: Referential Dangling as a Paradigm-Level Failure Mode in Hard Prompt Compression压缩长文档的提示压缩器常常保留了答案句子,却删掉了理解这个答案所需的关键信息
- Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes一项控制实验研究:语言、图像理解与图像生成在同一模型中联合训练时如何互相促进或干扰
- Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming不靠强化学习重新训练,靠写攻击笔记来持续变强的AI代理红队系统
- The Loss Does Not See the Basis, but Adam Does梯度下降和Adam会不知不觉地收敛到不同的解 —— 原因是损失函数看不见的一种对称性
- Small Foundation Models of Human Cognition and Behaviour参数量只有几亿到十亿的小模型,在同类实验上就能追平700亿参数大模型对人类选择行为的预测能力
- MatrAIx: Simulating the World with 8.3 Billion Persona AgentsMatrAIx用83亿个模拟人格代替真人来测试AI产品
- WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks一个用来检验多个用户的私人AI代理协作时,是否会被攻击者诱导泄露隐私或接受伪造权限的实验平台
- When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills一项基准测试表明,把聊天记录压缩成可复用的'人设技能'交给AI代理后,不仅隐私信息会泄露,代理甚至能模仿用户本人的说话方式冒充其身份
- RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States让自我进化的LLM智能体记忆越积越乱、奖励误发的问题,被压缩成四个固定格子解决
- SkillJack: Persistent Skill Backdoors in Self-Evolving Agents新型攻击SkillJack让自我进化的AI智能体把恶意行为悄悄写进自己的常用技能库
- What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems让AI在图像编辑对话中推荐用户真正会点、又符合当前图片实际内容的下一步编辑建议的三阶段训练法
- Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing腾讯混元团队推出Buffalo 1.0,把3D理解、生成和编辑统一到一个模型里
- Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data研究者把人类第一视角操作物体的视频转换成18,561小时的机器人训练数据,覆盖15种机器人形态,并验证它是否真能提升机器人策略的泛化能力
- SWE-Touch: Benchmarking Coding Agents When Users Touch the Code一个测量编码智能体在任务进行中被用户直接改动代码时会崩到什么程度的基准
- SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks一个统一的语音音频生成模型:仅靠一段文字描述就能设计出全新角色声音,之后还能用参考录音重新调用同一个声音
- RestoreKV: Recovering Full-Cache Behavior Under Aggressive Query-Agnostic KV Cache Eviction给压缩过头的KV缓存加上8个可学习的恢复token,让效果重新接近未压缩时的水平
- FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds让AI在人车混杂、拥挤混乱的“全球南方”城市场景中,把未来预测拆成布局、行人车辆、互动关系三条通道分别处理
- SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space让机器人用生成动作的同一个策略来预测未来,比用单独的预测模块效果更好
- Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval拆解一个仅凭脑磁图就能猜出你刚听到哪段话的AI,看看它到底用了大脑哪些区域和声音的哪些特征
- 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering3D问答AI把视觉token从约1400个压缩到128个,准确率仍保留94.7%
- OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution把AI智能体放进会持续变化的长期工作环境里测试,比只测一次性对话能暴露出更多安全问题
- MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language ModelsMMOOC用4万1千道题检验多模态AI能否拒答真正无法回答的问题,同时不放弃能够回答的模糊问题
- CADENA: Stepwise CAD Reverse EngineeringAI不再一次性吐出整份CAD代码,而是像人类工程师一样一步步搭建并随时检查
- DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion LatentsAI不生成视频,只偷看生成中的视频内部信号,就能预测物体接下来会怎么动
- DarwinX: Evolving Agent Harnesses Through Natural Selection不改模型权重,只靠自然选择式的方法进化AI智能体的'外壳'(提示词与工具组合),就带来了实质性能提升
- DiffusionGemma Technical Report谷歌的DiffusionGemma是一款实验性开放权重模型,通过并行打磨256个token组成的区块,让文本生成速度远超逐词生成的传统AR模型
- MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations让LLM智能体经营365天网店,结果大多数比人类更快就撒手不管了
- Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning研究揭示大模型遇到超出能力的难题时会编造看似合理却错误的推理,并训练模型学会说"我解不出来"
- SAF-OPD: Stable Advantage Fusion for On-Policy Distillation把验证式强化学习和模仿老师模型的训练直接相加,AI会停止探索 - SAF把这个失控信号驯服后效果更好
- Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures一套判断AI智能体失败究竟是模型的锅、工具框架的锅还是环境的锅的分类法
- Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI AgentsQwen-UI-Agent是一个把真机屏幕点击和命令行操作结合起来完成多步任务的GUI智能体,而不只是在模拟器里表现好
- To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code EditingAI编程模型即使被要求删除代码,也常常悄悄把旧代码留下来
- OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models研究发现,用来判断AI操作电脑代理是否真正完成任务的AI裁判其实很容易被骗
- ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine一套设备同时记录一个人做家务时的第一人称视角、全身动作、手部动作、声音和触觉,用来做机器人训练数据
- Constitutional Midtraining: Content Presence Drives Alignment Gains在模型学会回答之前先让它读原则性文本,安全行为能保持更久
- LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation一种能在单步推理下实时生成高帧率说话人视频、且长时间不会走形变脸的方法
- VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System让视频生成AI先用可执行的Blender代码把物理过程画成草稿,再变成逼真视频
- Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes为大模型解码提速的“有损验证”技巧,实际上会悄悄扭曲输出分布并损害生成质量
- Weak-to-Strong On-Policy Distillation只靠比学生更弱的模型,也能把学生AI训练得更强
- Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models多模态AI不是看不到图像,而是看到了却控制不住要不要信它
- OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models在同时看视频、听声音的AI模型中,让一种感官替另一种感官做决定,可能会把答案丢掉
- DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking DialoguesAI语音助手该根据场景改变何时插话、何时倾听,少量人类反馈就能教会它
- INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models无需昂贵搜索,世界模型也能把想要的目标直接变成可执行的动作
- Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KVAI即便删掉了原始信息,依然能答对——因为那个值早已悄悄渗入了留下的另一句缓存里
- When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles训练一个AI去读懂另一个AI的内心想法,结果它反而学会了对自己训练时接触的那个秘密视而不见
- Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions只要塞进一篇看起来像真论文的假文档,AI深度研究智能体就可能在最终报告里得出错误结论
- What AI Red-Team Evaluations Can and Cannot ProveAI红队测试说'没发现问题'时,这句话到底能证明多少,是可以算出来的
- Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements把完整财务报表原样喂给AI、再拿掉计算公式提示,连最强模型也会算错近一半
- Multi-Head Attention Residuals让Transformer回看过去层信息时,不用一个共享问题,而是让每组特征各问各的,效果更好
- AI Tour Meeting: Group Travel Planning by LLM Agents多个带人设的LLM智能体通过讨论和投票就团体旅行行程达成共识的框架
- Pedestrian Archetypes Extension -- More Pedestrian Models for Autonomous Vehicle Safety Testing自动驾驶汽车需要留意的危险行人类型又增加了7种
- AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities终于有一个基准能检验视频编辑AI是不是把声音也一起改对了,作者还顺手给出了做得更好的智能体