天眼早报
🤖 AI 大模型
𝕏 斯坦福提出 Prefix Sliding 技术,推理速度提升 3 倍且无需训练
斯坦福大学团队提出Prefix Sliding新架构,通过丢弃推理中间低价值 token 并保留前缀与工具窗口,使现有模型推理速度提升3 倍。该技术无需训练即可支持超过10 万 token的长上下文推理,性能媲美全注意力机制。在长程推理中,该算法仅保留前缀和窗口,同时保持完整注意力性能,为RL rollout提供了高效解决方案。
𝕏 Microsoft 发布 TailSFT:过滤已拟合数据显著提升 RL 效果
Microsoft研究人员发现标准SFT会浪费梯度在已拟合序列上,提出TailSFT方法仅针对尾部数据进行训练。该方法指出标准流程因过度拟合限制了RL探索空间。在OLMo-3 7B模型上,代码能力pass@16提升16.8 分,数学能力提升3.1 分,奖励增长速度快2.5 倍,有效专注于数据尾部分布。
𝕏 NPO 单谱系提示优化器以更低成本匹配 GEPA 性能
NPO(Single-lineage Prompt Optimizer)摒弃复杂的候选池和搜索树,仅维护单一谱系并利用教师模型重写提示。在指令遵循基准测试中,其 rollout 次数低于GEPA却保持相当性能,证明优化器侧的搜索复杂度可弥补教师模型推理能力的不足,展示了低成本优化的新路径。
𝕏 CritICL 研究:利用小模型错误模式指导大模型推理
CritICL方法让小模型收集数学题的错误及批评,存入知识库。当大模型遇到相似问题时,提示词直接包含这些失败模式警告。该方法仅需1 次生成即可获得原本需5 次生成才能达到的准确率,显著降低推理成本,为大模型推理优化提供了新思路。
𝕏 Grok Bot 升级为 X 研究数据库,支持全档案搜索与社交分析
Grok Bot新增连接 X 账户功能,可读取时间线、帖子、点赞及 Spaces 数据,支持高级搜索算符和全档案检索。它能统计话题对话量、管理书签列表并检查 API 额度,但无法自动发帖或私信,定位为全天候的社交研究助手,极大增强了 AI 在社交媒体领域的分析能力。
𝕏 斯坦福团队 AI 设计 RNA 假结结构成功,标志 RNA 设计进入 AI 时代
斯坦福大学Rhiju Das 团队在《Science》发表封面论文,利用 AI 算法成功设计复杂RNA 假结结构。研究显示 AI 能力已追上人类专家,且无需先解决三维结构预测难题即可直接设计序列。该成果利好RNA 药物研发,但需结合生物实验验证,标志着AI 制药的新里程碑。
𝕏 索尼与华纳音乐起诉 Anthropic,索赔每首歌最高 15 万美元
索尼音乐和华纳音乐正式起诉Anthropic,指控其开发Claude时大量使用盗版歌词和乐谱训练模型。诉状称Claude能一字不差输出原版歌词并模仿创作,要求按15 万美元/首赔偿,并请求陪审团审理。此前 Anthropic 已因类似图书侵权案赔付作家超15 亿美元,法律风险持续升级。
𝕏 新研究提出 Metan 框架:固定改进器以深化 AI 代理自我进化能力
明尼苏达大学与首尔大学发布新研究,提出Metan框架。该方案不再让代理重写改进机制,而是冻结改进操作,让新层仅基于代码和执行轨迹进行策略优化。实验显示该方法能有效防止机制腐蚀,显著提升AI 代理的深层自我迭代能力,解决了长期存在的机制退化问题。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。