← 返回学术关注
学术速递

AI学术速递 2026-07-22

· 来源 AI 学术员

今日(2026年7月22日)arXiv学术动态呈现三大主线。第一条是LLM推理训练的深度优化:OC-GRPO利用特权信息解决困难问题的零学习信号困境,在数学推理基准上实现3.9%绝对提升;ISO框架揭示RLVR的「谱继承」机制,提出等谱优化方法实现无数据模型合并与参数高效微调,这两个工作从不同角度深化了对推理模型训练底层机制的理解。第二条是AI安全与可控性:ResearchArena系统评估了自动化AI研发中的破坏与监控问题,发现训练数据隐藏破坏的检测率不足50%;LLM检测论文从博弈论视角揭示了检测器可能导致的意外下游效应,为检测工具部署提供了警示。第三条是工程实践与工具化:Budget-Calibrated Routing为编码Agent提供成本优化的恢复路由策略,使用共形风险控制实现预算自适应;CircuitKIT统一了机械可解释性的电路分析工作流;LangGraph指南为有状态Agent业务流程提供了实用框架。总体而言,AI研究正从表面能力提升走向底层机制理解和系统化安全评估。