天眼早报

科技|2026年09月03日|230 分钟阅读
来源:921 条推文 + 993 篇 RSS 文章·Lanyun·BatchV2 生成·2026-09-02 — 2026-09-03
分享
AI 速读14 条精选
🤖头条李飞飞发布全球首个多模态世界模型 Atlas

World Labs 创始人李飞飞正式发布 Atlas,这是全球首个面向空间智能的 Omni World Model。该模型原生处理文本、图像、视频及 3D 深度信息,仅需 1-6 张照片即可生成 1440p 分辨率、长达 1 分钟的视频,并支持精确的相机位姿控制与空间几何重建。这一突破标志着空间智能领域的重大进展,无需数百个机位即可还原“子弹时间”效果,将极大推动影视制作与虚拟现实的效率变革。

🤖头条Google DeepMind 发布 Gemini 3.8 Flash 及安全版 Cyber

Google DeepMind 正式发布 Gemini 3.8 Flash 及安全版 Cyber。前者基于递归深度推理技术,在 Agent Arena 排名升至第 7,超越 Claude Opus 5,Terminal-Bench 测试达成 89.4% 完成率;后者专为安全团队设计,漏洞发现成功率超 70%,补丁生成量为竞品 2.6 倍。两款模型维持优惠定价,年底后调整,将重塑企业级 AI 应用与安全防御的竞争格局。

🏛头条特朗普政府正式支持 OpenAI 版权诉讼立场

美国司法部在 OpenAI 与纽约时报的版权诉讼中提交意见书,明确支持 AI 训练属于合理使用(Fair Use)。文件指出利用受版权保护文本训练大语言模型具有变革性,不应受到广泛限制,否则将损害美国国家安全及产业竞争力。这一政策风向为 AI 行业的长期发展扫清了关键法律障碍,确立了数据使用的合法性基础。

💡头条NVIDIA 拟以 140 亿美元收购 Hugging Face

据 Bloomberg 报道,NVIDIA 正接近以 140 亿美元收购开源模型平台 Hugging Face,最快本周达成协议。此举将强化 NVIDIA 在 AI 生态中的基础设施地位,整合其算力优势与社区模型资源,可能彻底改变开源模型市场的竞争格局,加速 AI 从研发到部署的全链路闭环。

📰头条OpenAI ChatGPT Ads 年收入突破 10 亿美元

OpenAI 宣布 ChatGPT Ads 在上线不到 200 天后,年化收入突破 10 亿美元。平台已扩展至 40 多个国家,中小企业成为重要收入来源。这一里程碑事件证明了 AI 广告模式的商业可行性,为 OpenAI 的盈利路径提供了强力支撑,标志着 AI 商业化进入规模化变现阶段。

🤖Anthropic 推出 Fable 5.1 与 Mythos 5.1,缓存成本降低 75%
🤖Meta 发布 Muse Spark 1.3,长程任务能力显著提升
🤖欧洲旗舰大模型 Quasar 438B 发布
📰智谱入驻天猫开旗舰店,上架 GLM-5.3 订阅套餐
📰AREX:4B 模型通过递归自改进超越 122B 专家混合模型
📰C-SafeQA:首个中文安全 QA 基准,揭示对抗查询风险
📰Uber 工程团队分享:超大规模业务下落地软件工厂经验
🤖Cursor 支持在用户自有基础设施上运行云智能体
📰G20 财长峰会因中国缺席未发表共识声明

🤖 AI 大模型

李飞飞发布全球首个多模态世界模型 Atlas

World Labs创始人李飞飞正式发布Atlas,这是全球首个面向空间智能的Omni World Model。该模型原生处理文本、图像、视频及 3D 深度信息,仅需1-6 张照片即可生成1440p分辨率、长达1 分钟的视频。它支持精确的相机位姿控制与空间几何重建,无需数百个机位即可还原“子弹时间”效果,标志着空间智能领域的重大突破。

Google DeepMind 发布 Gemini 3.8 Flash 及 Cyber 版

Google DeepMind正式发布Gemini 3.8 Flash及安全版Cyber。前者基于递归深度(recurrent depth)推理技术,在Agent Arena排名升至第 7,超越Claude Opus 5,在Terminal-Bench测试达成89.4%完成率;后者专为安全团队设计,在真实测试中以70%+成功率发现漏洞,生成2.6 倍于竞品的正确补丁。两款模型均维持**$0.75/$3.75**的优惠定价,并将在年底后调整价格。

Anthropic 发布 Fable 5.1 与 Mythos 5.1,缓存成本降低 75%

Anthropic发布Fable 5.1Mythos 5.1,典型负载成本比 Fable 5 降低25%,高度 Agentic 任务最多便宜45%Cache read降价使得长程任务成本大幅下降,同时新模型在文档OCR解析任务上实现突破,表格和图表理解能力增强,Hacker News 主帖热度超1200 points,成为开发者关注的焦点。

𝕏 Meta 发布 Muse Spark 1.3,长程任务能力显著提升

Meta推出Muse Spark 1.3**,在智能体任务和代码生成方面表现优化。相比 1.2 版本,工具调用减少20%,Token 消耗降低25%。在 MRCR 256K–512K 长上下文测试中得分98.5,接近Opus 5水平,每任务成本低至**$0.55**,成为同智能水平下最具性价比的模型,重新定义 Agent 竞争格局。

Meta 发布实时音频感知 AI 模型 Muse Voice Transcribe

Meta推出首个实时音频感知模型Muse Voice Transcribe,整合流式语音识别、说话人分离与端点检测。用户说话时系统可同步输出文字,无需等待录音结束。截至 9 月 1 日,该模型位列Artificial Analysis流式语音转文本排行榜第 1 名,推动Meta股价重回 600 美元上方,展现了其在实时交互领域的强大实力。

Anthropic 推出企业级前沿防护机制 EFS

Anthropic宣布推出**Enterprise Frontier Safeguards (EFS)**架构,旨在解决企业客户对零数据留存滥用检测的双重需求。该方案将监控数据存储于客户控制的云基础设施中,而检测逻辑保留在Anthropic侧,预计今年秋季分阶段上线。这一举措有效平衡了企业合规要求与安全防护之间的矛盾。

📡 特朗普政府正式支持 OpenAI 版权诉讼立场

美国司法部OpenAI纽约时报**的版权诉讼中提交意见书,明确支持AI 训练属于合理使用(Fair Use)。文件指出,利用受版权保护文本训练大语言模型具有变革性,不应受到广泛限制,否则将损害美国国家安全产业竞争力,为 AI 行业的长期发展扫清了法律障碍。

OpenAI API 疑似暂存 GPT-6 Astra

博主发现OpenAI API接口对gpt-6-astra返回404错误,推测该模型已暂存待发布。此前泄露信息显示,Astra模型在ExploitBench100%满分,内部测试发现两个零日漏洞,且对越狱请求拒绝率从59%升至91.5%,被定义为首个达到临界网络安全阈值的模型,显示出极强的安全性。

🔶 Claude Fable 5.1 系统提示词遭黑客泄露

Claude Fable 5.1发布后数小时,知名黑客Pliny the Liberator公开了长达27.5 万字符的系统提示词(System Prompt)。该泄露内容揭示了模型的安全限制与内部指令细节,引发行业对大模型安全边界的广泛讨论,同时也暴露了当前模型在防御高级社会工程学攻击方面的潜在弱点。

OpenAI 宣布 ChatGPT Ads 年收入达 10 亿美元

OpenAI宣布ChatGPT Ads在上线不到200 天**后,年化收入突破10 亿美元。平台已扩展至40 多个国家,并开放自助服务入口至印度、欧洲等新兴市场,中小企业成为重要收入来源。这一里程碑事件证明了 AI 广告模式的商业可行性,为 OpenAI 的盈利路径提供了强力支撑。

欧洲旗舰大模型 Quasar 438B 发布

Multiverse Computing正式推出Quasar 438B,作为欧洲领先的 AI 模型,其参数量高达4380 亿。该模型旨在提升欧洲在基础大模型领域的竞争力,支持多语言及复杂推理任务,填补了欧洲在超大规模开源或闭源模型领域的空白,增强了区域技术自主性。

OpenAI Astra 采用循环架构引发安全担忧

The Information报道,OpenAI即将发布的Astra模型采用循环 Transformer(Looped Transformer)架构。该架构允许模型在生成输出前多次迭代处理信息,虽提升推理效率,但导致内部思维过程不可见,增加了黑盒风险安全审计难度**,引发了业界对模型透明度的新一轮讨论。

NVIDIA 接近以 140 亿美元收购 Hugging Face

Bloomberg报道,NVIDIA正接近以140 亿美元收购开源模型平台Hugging Face,最快本周达成协议。此举将强化NVIDIA在 AI 生态中的基础设施地位,整合其算力优势与社区模型资源,可能彻底改变开源模型市场的竞争格局。

𝕏 Claude 桌面版新增后台电脑控制功能

Anthropic宣布Claude**可在 macOS 桌面端后台自动操作电脑。用户可授权其在后台点击、输入和打开应用,实现Computer Use功能。该功能目前面向ProMax订阅用户在设置中开启,标志着 AI 从对话助手向自动化执行者的转变,极大拓展了 AI 在日常办公中的应用场景。

智谱入驻天猫开旗舰店,上架 GLM-5.3 订阅套餐

智谱华章正式入驻天猫开设官方旗舰店,销售基于最新GLM-5.3模型的订阅服务。个人版 Lite 月费118 元,Pro 月费538 元,Max 月费1078 元,标志着大模型服务进入传统电商消费场景,降低了中小企业和个人用户的获取门槛,加速了 AI 技术的商业化普及。

📄 OpenAgentFlow:构建异构 AI 智能体集群的系统级安全边界

OpenAgentFlow提出一种控制平面/执行平面架构,在Android平台上实现94.0%的准确率与95.3%的攻击拦截率。该系统通过统一AgentEvent流和策略执行点,解决了多智能体环境下的安全治理难题,为未来复杂的智能体协作提供了可靠的安全框架。

📄 ReDeck:基于渲染反馈的文档转幻灯片生成新框架

ReDeck提出一种步骤级渲染 grounded 优化框架,将幻灯片修订分解为原子编辑动作,并在每一步返回渲染器观察结果。该方法在GPT-5.4Claude-4.6等模型上显著优于现有方案,有效解决内容溢出和对齐问题,大幅提升了自动化演示文稿生成的质量与效率。

📄 EULER:多智能体系统实现数学猜想跨域证明

EULER是一个多智能体系统,以“桥梁”为单位搜索跨领域数学证明。在120个近期猜想测试中,成功产出10个证明和3个反例。该系统通过特定的压力测试机制,有效减少了错误结论的产生,展示了多智能体协作在解决高难度数学问题上的巨大潜力。

📄 IMPACT:改进世界模型交互能力的注意力校准框架

IMPACT框架通过先验引导的注意力校准和目标定位,解决了世界模型在物理交互建模中的不足。实验显示,其在机器人手臂和人手操作任务中,相比传统 MSE 训练基线,显著提升了交互保真度物理合理性,为具身智能的物理模拟提供了新的技术路径。

𝕏 Grok Bot 安卓版本正式发布

xAI**宣布Grok Bot安卓客户端正式上线,用户可下载体验。此前该应用主要面向 iOS 平台,此次更新标志着其移动端覆盖范围的扩大,让更多 Android 用户能够直接使用 Grok 的强大 AI 能力,进一步巩固 xAI 在移动端的用户基础。

𝕏 Obsidian 1.14.0 早期访问版发布

Obsidian发布1.14.0**早期测试版,核心更新包括Kanban 看板视图、iOS 快速捕获组件以及支持 Emoji 高亮语法(如==🔵blue==)。这些新功能增强了笔记管理的灵活性和视觉表达力,满足了知识工作者对高效组织和个性化展示的需求。


🛠️ AI 工具推荐

𝕏 Meetily:本地离线 AI 会议转录工具,保障数据隐私

Meetily 是一款基于 RustTauri 构建的本地会议转录工具,支持 WhisperParakeet 引擎,完全离线运行,数据不离开设备。已获 28,500+ GitHub Stars,MIT 开源免费。对于注重数据隐私的企业和个人,Meetily 提供了安全的会议记录解决方案。

𝕏 Cursor 支持在用户自有基础设施上运行云智能体

Cursor 宣布新增功能,允许用户在 AWS LambdaCloudflare 等支持的沙盒提供商或自有机房运行 Cursor Cloud Agents。此举使智能体能访问内部服务或专用硬件,同时保持 Agent 循环在 Cursor 内运行。这一更新实现了数据本地化与自动化结合,满足了企业对数据隐私的严格要求。

NVIDIA 发布 Switchyard:跨 LLM API 的 Rust 代理与路由库

NVIDIA 开源 Switchyard,一款基于 Rust 的轻量级代理库,用于在不同 LLM 提供商(如 OpenAIAnthropic)之间路由和转换流量。它支持将请求解码为中性格式,通过路由算法选择后端,并重新编码响应,解决了多模型集成的兼容性问题,提升了系统的灵活性。

📄 CUDA-Harness:自然语言生成与优化 CUDA 内核的代理框架

CUDA-Harness 是一个创新的代理框架,通过中间结构化生成和合成验证机制,解决了从自然语言直接生成 CUDA 内核的难题。该框架能有效防止奖励黑客行为,并在多个 LLM 和硬件平台上展示了良好的泛化能力。它填补了自然语言编程与底层高性能计算之间的鸿沟,为开发者提供了更可靠的代码生成方案。

📄 Scientific Agent Skills:科研代理程序知识库

新发布的 Scientific Agent Skills 库包含 163 个经过版本化的程序,涵盖基因组学、化学信息学等 16 个科学领域。每个程序都配有指令文件和参考脚本,旨在帮助 AI 代理执行可辩护的科学分析任务。这一开源资源极大地降低了科研代理构建的门槛,推动了 AI 在科学研究领域的深度应用。

𝕏 shadcn 开源 cn:30 倍速提升的 Tailwind 类名合并引擎

shadcn 团队开源 cn 引擎,作为 tailwind-mergeclsx 的替代品。新引擎在所有框架中通用,运行速度提升 30 倍,且包体积更小。开发者可通过一条命令 npx shadcn migrate cn 完成迁移,解决类名冲突问题,显著优化前端构建性能。

Ollama 本地部署大模型实战指南:量化与 HTTP 接口

文章详细介绍如何使用 Ollama 工具在本地电脑下载并运行 Qwen3:0.6B 等模型。内容涵盖 模型量化Q4_K_M)技术以节省内存、命令行操作演示以及开启 HTTP 服务 进行调用的完整流程。适合开发者快速搭建私有 AI 环境,实现离线推理。

🐙 ReClip:开源自托管视频下载器,支持 1000+ 网站 MP4/MP3 提取

ReClip 是一款轻量级、自托管的开源视频和音频下载器,提供干净的 Web UI。它支持从 YouTubeTikTokInstagram1000+ 网站下载视频,可提取 MP4MP3 格式,支持批量下载、自动去重及质量选择。基于 Python 构建,无框架依赖,易于部署。

Nuxt 4.5 发布:实验性 SSR 流式传输与 Vite 8 升级

Nuxt 框架发布 4.5 版本,核心升级包括迁移至 Vite 8、引入基于 RsbuildRspack 2 构建器。新增 实验性 SSR 流式传输 功能可显著缩短首字节时间,同时提供稳定的错误代码系统和新的 useLayout 组合函数。这是前端开发体验的一次重大飞跃。

𝕏 Thaw v2 发布:开源 macOS 菜单栏图标管理工具

jaywcjlove 正式发布了 Thaw v2,这是一款专为 macOS 设计的开源菜单栏图标管理工具。该工具旨在帮助用户高效整理和隐藏系统托盘中的繁杂图标,提升桌面整洁度与操作效率。相比旧版本,v2 在功能上进行了优化,能够更灵活地控制应用图标的显示与隐藏状态,是 Mac 用户管理系统托盘的得力助手。

𝕏 HESIM:混合事件相机模拟器

首个混合事件相机模拟器 HESIM 正式发布,支持生成空间对齐的 RGB 和事件数据。该工具旨在加速算法开发,无需等待大规模数据集和硬件普及。作为视觉感知领域的重要工具,HESIM 将在 ECCV 2026 展示,为研究人员提供低成本、高效率的仿真环境。

𝕏 Notion AI 新增模型控制功能

Notion 发布新功能,工作区管理员可自定义 Notion AgentCustom Agents 可用的模型,并设置默认模型。此更新增强了企业对 AI 模型选择的管控能力,新设置位于“设置 → Notion AI → 常规”中,允许团队根据任务需求灵活配置不同大语言模型的调用策略。

🐙 XHS-Downloader:小红书链接提取与作品采集工具

XHS-Downloader 是一款基于 Python 开发的开源工具,支持提取 小红书 链接和采集作品。该工具兼容 Tampermonkey 脚本,可帮助用户高效获取社交媒体内容,适用于数据分析和个人收藏场景。其简洁的架构使其易于部署和使用,是内容创作者和数据分析师的实用工具。

𝕏 OpenWiki 集成 Cursor,简化代码智能体开发

LangChain 宣布 OpenWiki 现已集成 Cursor 编辑器。开发者只需两条命令即可启用 OpenWikiCursor 的连接,实现知识库与代码编辑器的无缝协作。这一集成提升了智能体开发效率,让开发者能够更便捷地利用外部知识增强代码生成能力。

📄 Dr. Claw:AI 科学家工作区与可审计研究流程

Dr. Claw 将命令行代码代理封装为可控的人机协作工作区,通过持久化状态对象和技能库连接人类决策与 AI 执行。相比裸机代理,它在研究完整性和可追溯的流程记录上表现更优,支持失败恢复与审计。这一工具为科研人员提供了一个安全、透明的实验环境,增强了 AI 辅助研究的可靠性。

🐙 club-3090:RTX 3090/4090/5090 本地运行 LLM 配置指南

club-3090 仓库收集了在 RTX 3090/4090/5090 显卡上运行 LLM 的配置方案。支持 vLLMllama.cpp 等多种引擎,提供 Qwen3.6Gemma 4 等模型的优化配置。该资源适合家庭实验室和开发者搭建本地 AI 后端,大幅降低了个人部署大模型的硬件门槛。

🐙 OpenClaude:开源终端 AI 编程助手,支持多模型云本地部署

OpenClaude 是一款开源的云端和本地模型编程代理 CLI 工具。它允许用户使用 OpenAI 兼容 APIGeminiGitHub Models 等多种后端,保持统一的终端优先工作流。支持提示词、工具、Agent、MCP 及斜杠命令,适用于开发者高效编码场景,实现了多模型管理的统一入口。

𝕏 Conversation Coach:语音驱动的职场对话练习系统

Conversation Coach 采用端到端语音模型,为管理者提供低延迟、高拟真的困难对话演练。生产环境数据显示,其识别速度达 220+ wpm,是传统打字的 5 倍。该系统自 8 月 31 日 起被 Google Play 列为精选应用,帮助职场人士在真实场景下提升沟通技巧。

📄 mimeo:将公共专家语料编译为智能体技能的工具

mimeo 是一款开源工具,自动抓取专家公开作品,验证引用准确性并生成智能体可加载文件。测试显示其在处理 obscure 引用问题上表现优异,能准确还原专家立场,为智能体提供紧凑、可检查的参考知识库。这一工具解决了大模型在专业领域知识幻觉的问题,提升了智能体的专业度。

🐙 mjlab:基于 MuJoCo-Warp 的强化学习与机器人研究框架

mjlab 结合了 Isaac Lab 的管理者 API 与 Google DeepMindMuJoCo Warp 加速引擎。该框架为环境设计提供了可组合的构建块,支持高效的强化学习和机器人仿真研究。作为学术界和工业界的重要工具,mjlab 显著提升了物理仿真的速度和灵活性。

🐙 Robin:AI 驱动的暗网 OSINT 调查工具

Robin 是一款 AI 赋能的暗网开源情报(OSINT)工具。它利用 LLM 优化查询、过滤搜索结果并提供调查报告摘要。该工具采用模块化架构,支持搜索、爬取和 LLM 工作流的分离,适用于安全研究人员进行暗网调查,提升了情报收集的效率和准确性。

𝕏 Repurposing HQ:一键将 Newsletter 转化为多平台内容

Repurposing HQ 工具可将 Substack 等 Newsletter 内容自动重制为 Twitter 线程、LinkedIn 帖子等格式,保持作者语气,解决内容分发痛点。该工具通过自动化流程,帮助创作者高效地将长文内容转化为适合不同社交平台的短内容,大幅提升内容传播效率。


📖 教程攻略

⭐ 教程:多模型 Chatbot 如何实现跨模型上下文压缩 (Compact)

针对官方 Compact 功能仅支持 GPT 系列的局限,文章详细拆解了如何在服务端实现通用的上下文压缩算法。通过调研 OpenAI、Anthropic 文档及 LangChain,解决了跨模型切换时加密块丢失的问题,实现了纯文本回放机制,有效提升了多模型协作效率。

⭐ 技术解析:DeepSeek Harness 沙箱隔离策略与三种模式详解

深度解析 DeepSeek Harness 的安全层设计,介绍 read-onlyworkspace-writedanger-full-access 三种沙箱模式的权限差异。文章结合源码展示了进程隔离策略,为构建安全的 Coding Agent 提供了架构级参考,确保代码执行环境的安全性。

🟩 如何激活无大学邮箱的 Azure for Students 账户

针对无法使用大学邮箱的用户,文章提供两种路径激活 Azure for Students:一是上传官方学术证明文件进行验证;二是利用 GitHub Student Developer Pack 作为学生身份凭证。内容详细列出了准备微软账户及具体操作步骤,解决了身份验证难题。

📱 ⭐ 突破 Windows 更新暂停上限:自定义 PowerShell 脚本指南

本文介绍如何通过编写 PowerShell 脚本,突破 Windows 累计更新最长 35 天 的暂停限制。该方案适用于需要长期稳定环境的开发或测试场景,帮助用户实现更灵活的更新管理策略,避免系统自动更新干扰工作流。

🟩 构建异步 PPT 转视频工作流以避免重复任务

文章以 Tome AI 为例,解析如何设计异步长耗时任务的生成流程。重点介绍了提交前验证(如文件大小、幻灯片数量限制)、固定成本展示以及防止重复提交的接口设计策略,为处理 PPT 转视频 等耗时操作提供了可靠的架构参考。


💎 技巧经验

🟩 Kubernetes Pod 频繁重启排查:Liveness 与 Readiness 探针的正确用法

分享了一个 Kubernetes 调试案例:Pod 每 40 秒重启是因为混淆了LivenessReadiness探针。正确做法是使用Startup Probe处理慢启动预热,用Readiness控制流量接入,仅在真正死锁时使用Liveness杀死进程,避免误杀正在初始化的服务。

🟩 生产环境 LLM 内存检索失败的隐蔽陷阱与防御策略

深入分析了 LLM 内存层在生产环境中“静默失败”的原因:向量检索返回不相关结果而非报错,导致模型自信地胡说八道。防御策略包括在检索后添加断言验证、监控检索分数漂移,以及建立明确的“上下文”与“记忆”分离机制,保障系统可靠性。

𝕏 离线 AI 设备投资逻辑:买的是认知而非省钱

博主分享观点,深度 AI 用户跑长线任务硬件划算,但普通用户线上 API 成本低。Mac显存带宽优秀但 Prefill 差,需理性选择。购买设备本质是投资,目的是获得离线 AI的认知优势,从而在未来社会竞争中建立壁垒,而非单纯为了省钱。

🟩 告警疲劳治理:从监控指标转向 SLO 症状告警

分享了消除告警风暴的经验:不再对 CPU、内存等基础指标设置阈值,而是基于SLO(服务等级目标)和用户感知症状(如错误率、延迟超时)触发告警。通过将告警数量减少三分之二,反而提高了对真实故障的响应速度和准确性,优化运维体验。

AI 时代普通人如何精简 Prompt 写作技巧

随着模型变强,提示词工程不再需要冗长的咒语。文章建议采用最小结构:任务 + 背景 + 结果 + 边界 + 验收。强调只需告诉模型目标、关键约束和完成标准,利用 API 的 Structured Outputs 处理格式,而非依赖文字反复强调,大幅提升交互效率。

Agent 控制方式从“人盯住每一步”转向“规则约束每一步”

对比 Anthropic 减少人工批准与 OpenAI Agent 失控案例,指出 Agent 控制的核心转变。通过内容探针和动作分类器,将风险控制在 0.3% 以下,证明系统定义好规则后,减少弹窗反而能提升效率与安全性的平衡。这是构建自主智能体的关键范式转移。


⚡ 工作流

𝕏 Uber 工程团队分享:如何在超大规模业务下落地软件工厂

Uber 工程团队分享了在超大规模业务下落地Agent 流水线的经验,实现 Agent 产品周活增长 7 倍,单次会话成本下降 52%。通过统一模型网关、MCP 网关、DevPod 隔离环境及 Skill 市场治理,构建了从需求到维护的完整闭环,实现了代码评审与 CI 自愈的自动化,为构建无人值守的黑灯软件工厂提供了关键参考。

𝕏 ⭐ 实践:构建无人值守的黑灯软件工厂,连续运行 8 天产出 100+ PR

该开源项目展示了如何构建无人值守的黑灯软件工厂,以 GitHub Issue 为唯一入口,实现从测试编写、代码实现、全量回归到 PR 合并的全自动流水线。系统利用状态机管理任务,连续运行 8 天 关闭 115 个 Issue,无需人工干预即可自动发版,验证了高自动化工作流的可行性与稳定性。

⭐ 工作流:GPT 做架构师 + 国内模型写代码的混合开发模式

作者探索了一种新的 AI 编程模式:让 GPT 负责需求分析和系统设计,再让 Claude Code 配合国内模型(如 GLMMiniMax)执行具体代码。测试显示该模式能有效解决国内账号限制和长程任务一致性问题,成功交付社群活动管理系统,是一种高效的混合开发策略。

𝕏 Higgsfield 插件:Blender 中锁定相机路径与演员的 AI 视频工作流

介绍 2026 年新的 AI 视频工作流:在 Blender 中使用 Higgsfield 插件预先锁定相机路径、演员与时间轴,再投入 credits 生成视频。该流程避免了盲目生成,显著提升了视频制作的效率与可控性,实现了AI 视频工作流的精准控制。

🟩 AI 编程上下文隔离工作流实践

针对 AI 编程工具因上下文污染导致错误的问题,提出“上下文预算”策略。通过限制代理可见的文件数、行数及测试结果,确保模型仅关注当前任务相关片段,提升代码生成的准确性。这种AI 编程上下文隔离工作流有效避免了信息过载带来的幻觉问题

🟩 从本地追踪到 Google AI Agent 的生产可观测性

本文分享了构建 Google AI Agents 生产级可观测性的方案,核心在于构建执行树(Execution Tree)以重构决策路径。通过区分模型调用、工具执行与验证步骤,解决了传统日志无法解释因果关系的痛点,为 AI 代理系统的调试与监控提供了标准化的技术路径。

🟩 构建生产级 Node.js + Express 后端架构的最佳实践

提供了一套生产级 Node.js 后端架构指南,强调将逻辑分层为Route(路由)、Controller(控制器)和Service(业务逻辑)。这种分层结构避免了代码耦合,使得项目在面对文件数量增长时依然保持可维护性,适合初学者到资深开发者参考。

🟩 移动端测试自动化框架:Java + BDD + 并行执行架构设计

详细介绍了一个基于JavaAppiumCucumber的移动测试框架搭建过程。重点解决了多线程并行执行时的资源冲突问题,通过ThreadLocal管理驱动实例、隔离端口和页面对象,实现了 Android 和 iOS 平台的统一测试脚本复用,确保了测试的高并发与稳定性。


📚 论文研究

📄 AREX:递归自改进深度研究智能体,4B 模型超越 122B 专家混合模型

AREX提出递归自改进框架,通过内外循环交替验证约束。在BrowseCompHLE基准上,4B 密集模型表现优于122B MoE基线,显著降低长程推理成本。这一成果挑战了传统认为“越大越好”的模型规模定律,展示了小模型在特定任务上的高效性。

📄 C-SafeQA:首个中文安全 QA 基准,评估 LLM 响应与裁判

C-SafeQA 包含538个基础查询和8,877个对抗查询,由37,660条记录组成。研究揭示了对抗查询下不安全响应率高达30.05%,且现有自动安全裁判在召回率与误报率间存在显著权衡,为中文大模型安全评估提供了关键基准。

📄 ARISE-RL:基于强化学习的智能体自进化框架

ARISE-RL 提出全周期自进化框架,通过Rubric(评分标准)中介的协同进化解决开放域任务奖励稀疏问题。引入RG-SED机制选择性蒸馏记忆增强策略,在ECR-Bench基准上实现SOTA性能,显著提升多工具任务的稳定性与鲁棒性。

📄 Instella-MoE:完全开源的 MoE 语言模型,总参数 160 亿

Instella-MoE 是完全从头训练的开源 MoE 模型,总参数160 亿,激活参数28 亿。在 AMD MI300X 上训练,Think checkpoint 在指令遵循等基准上平均分73.2,优于同类开源模型,总分76.7,全面展示了开源 MoE的潜力。

📄 CANOPY:仅靠结果强化学习即可训练长程交互式智能体

CANOPY 协议证明仅需Outcome-Only RL即可在小规模开源模型中内化长程能力。在 AppWorld 基准上,Qwen3-14B 策略登顶榜单,Test-Normal 得分86.9,无需辅助奖励或技能库,简化了长程任务的训练流程。

📄 EvoFlint:基于进化搜索的多轮大模型漏洞图谱构建

EvoFlint框架利用进化质量多样性搜索,针对Claude Sonnet 4.6GPT-5.4Qwen3-32B等模型进行多轮红队测试。结果显示攻击成功率分别达到35.8%59.7%94.3%,揭示了现有安全训练在长对话场景下的覆盖盲区。

📄 Low-Rank Clone:仅需 20B token 训练,效率提升 1000 倍实现大模型蒸馏

LRC方法通过低秩投影矩阵对齐教师与学生激活,使用20B tokens训练出的小模型性能超越万亿 token 训练的 SOTA 模型,实现1000x训练效率提升。该技术大幅降低了大模型蒸馏的算力门槛,为资源受限场景下的模型部署提供了可行方案。

📄 PRIS:AI 自主发现的晶体结构可塑性法则,筛选效率提升 67%

AI 代理通过主动反驳发现了8条无机结构可塑性规则(PRIS)。该法则能解释82-99%的实验结构,并将 DFT 验证队列减少67.3%,同时保留99.2%的目标候选者,展示了AI 科学发现在材料科学领域的巨大潜力。

📄 AgentFactory:自动化智能体系统设计与优化框架

AgentFactory 联合优化基础模型与工作流结构,通过三阶段流水线自动搜索最佳配置。在涵盖推理、编码、医疗等8 个基准测试中,平均提升9.1%,其中医疗领域提升19.6%,金融领域提升18.7%

📄 Workload Identification via Physical Side Channels:AI 治理的物理侧信道

证明可通过 NVIDIA H200 GPU 的功耗特征识别运行负载类型。外部观察者能以**97%**的准确率区分训练、推理和非 AI 计算,且不受内部遥测欺骗影响。针对四种逃避策略的硬化检测器能捕获**99%**的训练活动。

📄 TrialGPT 2.0:AI 辅助临床试验匹配系统,临床筛查时间减半

TrialGPT 2.0 在多中心前瞻性评估中,将医生筛查时间减少55.0%,并在回顾性队列中91%的案例中成功推荐了至少一个临床试验,扩展患者参与机会90.9%。该系统还发布了包含126个合成病例的NIH-TrialBench数据集,推动了AI 医疗的发展。

📄 ReST:面向工业推荐排序的序列 Transformer 扩展框架

ReST 针对行为序列建模提出新型 Transformer 扩展框架,在一周在线 A/B 测试中将广告平台 AUC 提升1.31%,核心营收指标提升11.93%,且在50ms延迟预算内完成。该框架成功应用于工业级推荐系统,平衡了性能与效率。

📄 Faster Flash Decoding:利用注意力稀疏性加速长上下文解码

提出FFD硬件 - 算法协同设计框架,通过低比特量化和内容感知扫描打破内存墙。该方法无需训练,可实现高达11.6 倍的内核加速,端到端吞吐量提升2.37 倍支持256K上下文长度。这一突破显著降低了长上下文处理的延迟和成本。

📄 MIDR:无需训练的 multimodal 文档检索新框架,性能超越 ColQwen2.5

MIDR 提出一种训练-free 的多模态索引增强框架,将推理移至索引阶段。在ViDoRe V3基准上,其混合模式取得0.6219平均 nDCG,较 BM25 提升23.0%,且索引内存仅为ColQwen2.51/9

📄 Delegation Without Trust:多智能体 LLM 系统的授权漏洞分析

分析了 LangGraph、CrewAI 等主流框架在多智能体系统中的授权漏洞。默认运行时无法抵御混淆副手、令牌窃取等威胁。提出的授权代理(Authorization Broker)能阻断所有四类威胁,将受损子智能体的可达动作限制在1.5 个以内

📄 HBQ:面向硬件效率的层次化块量化方案

HBQ提出层次化块量化技术,通过大块尺寸和低开销尾数缩放,W4A5精度下实现W4A16级别的准确率。实测显示其相比现有方法减少17%硬件成本,系统能耗降低1.6-3.3 倍,显著提升了硬件效率

📄 QTEA:亚 2 比特量化 LLM 的新框架

提出QTEA框架,将权重量化为三进制值并利用残差补偿,使Qwen3-14B的有效位宽降至1.7 比特。相比最强三进制基线,平均准确率提升16.7%,且生成速度提升7.2 倍,极大降低了量化成本。

📄 Neurosymbolics:无需微调实现长上下文 Token 缩减

该研究引入神经符号层,在不微调的情况下将LLM逻辑推理准确率提升85%,同时将长上下文 Token 使用量减少**50%**以上,并将时间复杂度从 O(n²)降至约 O(n)。该方法显著降低了推理芯片的计算压力。

📄 Cheap Verifiers, Large Blind Spots:低成本验证器的可靠性代价

测量了推理级联中廉价验证器的盲点。发现验证器的盲点随学生能力提升而扩大,且级联自身的仪表盘指标(如 3%错误率)完全无法反映真实的**32%**错误率,揭示了系统对自身退化的盲目性。这警示了过度依赖低成本验证的风险。

📄 Counterfactual Fragility Certificates:高置信度脆弱性审计

提出CFC协议,用于识别高置信度预测中的结构性脆弱点。在七个表格基准测试中,CFC-FDS 以0.915 AUROC识别出独立脆弱的案例,优于现有的非证书分数指标,为模型可靠性评估提供了新工具。

📄 zbMATH Open Knowledge Graph:追踪 250 年数学研究的超大规模知识图谱

zbMATH Open KG 包含3,400 万实体和1.68 亿三元组,覆盖250 多年数学文献。该图谱整合了专家审核的语义内容,支持跨世纪的 scholarly 关系探索,是数学研究的重要基础设施。

📄 Deterministic GitOps Remediation:LLM 修复 YAML 的确定性方案

指出 LLM 直接生成 YAML 文件存在非确定性风险,提出将语义决策与语法编辑分离的方案。该方案通过解析器定位精确字符跨度进行替换,确保编辑正确且格式保留,成本仅为 O(1),已开源为KubeAstra

𝕏 FM-Bench:揭示长周期代理评估的局限性

Stanford等机构发布FM-Bench**研究,模拟足球俱乐部管理20 年。发现短期表现与长期结果相关性极低(相关系数仅0.19),证明现有短任务基准无法预测长周期决策质量。

📄 EmbodiedSkills:统一框架协调 VLA 代理的训练与部署

EmbodiedSkills 提出统一框架处理视觉 - 语言 - 动作(VLA)代理的长程任务,通过执行提议、验证和恢复机制,在RoboTwin 2.0任务上达到86.20%成功率,LIBERO 套件达97.40%。该框架有效解决了具身智能在复杂任务中的协调难题。

📄 SupraTok:跨空格分词器,压缩率提升 17.5%且训练速度加快 2.1 倍

SupraTok突破传统分词限制,在100k 词汇量下比标准 BPE 压缩率高17.5%,训练速度快2.1 倍,并在多语言任务中取得34.9%相对增益。这种新型分词策略优化了Tokenization效率,显著提升了多语言模型的训练速度和推理性能。

📄 Listwise Selection for Text-to-SQL:用记忆替代训练

MaP-SQL 提出一种无需微调的列表式选择器,通过构建可重用结构化记忆替代微调目标。在 BIRD-dev 上,执行准确率比 R^3-SQL 高出2.02点,Token 消耗减少2.92倍,展示了记忆机制在 Text-to-SQL 任务中的优势。

📄 ReNFT:修复奖励后训练中的模式崩溃

提出ReNFT方法,通过内部概率质量重校准修复扩散生成器的模式崩溃。在 PickScore 和 GenEval 上,保留了**98.9%99.0%**的奖励,同时将 DreamSim 多样性分别提升58.8%55.0%。该方法有效平衡了生成质量与多样性。

📄 Athena:基于知识图谱补全的漏洞受影响库识别工具

Athena 首次将漏洞数据库建模为知识图谱,通过补全任务识别受影响库。在 VulLib 数据集上,其 F1 分数比最佳基线高出32%,且仅需1.1 亿参数即可超越70 亿参数的基线,显著优化了网络安全领域的资源效率。

📄 SinkPruner:去除注意力汇点的多模态大模型视觉 Token 剪枝

SinkPruner 通过过滤高范数异常值 Token,在减少89%视觉 Token 的情况下,仍能保留 LLaVA-1.5 原始性能的96.5%,显著提升 MLLM 推理效率。该技术为多模态大模型的轻量化部署提供了新思路。

📄 RecalibrateGPT:缓解 AI 疲劳的交互系统设计

RecalibrateGPT引入五个跨轮次操作符(Anchor, Replay 等),在两项试点研究中将用户感知认知负荷降低50%(NASA-TLX = 2.7),可用性评分(SUS)达到86.5,证明交互流程优化可显著改善用户体验。

📄 Calibration is the Bottleneck:多轮工具调用的行动类别诊断

研究提出行动类别诊断框架,发现多轮工具调用失败主要源于Action-Class Miscalibration而非执行失败。单一扰动可使不同模型家族准确率变化范围达**-21.0pp 至 +11.5pp**,揭示了工具使用中的关键瓶颈。

📄 Lagged Coupling:内部表征的可读性早于因果效力

研究发现 Pythia 系列模型中,线性探针可在第**1,000步读取目标变量,但沿该方向的干预在43/48情况下无效。这种“可读性滞后”现象表明表征形成可靠地快于因果读出整合,揭示了模型内部机制**的复杂性。

📄 Safer LLMs via Circuit-Guided Weight Scaling:电路引导的权重缩放提升安全性

识别了 LLM 安全电路的三个组件:有害检测头、安全神经元和拒绝头。通过电路引导的权重缩放,在六种 LLM 上将攻击下的安全评分提高了26.5%,而标准基准准确率仅下降1.7%。这是一种高效提升模型安全性的轻量化手段。

📄 Jailbreaking Text-to-Image Models:通过多智能体辩论绕过安全过滤器

提出CRACK多智能体辩论框架,通过攻击、防御和裁判智能体的迭代博弈,适应异构安全过滤器的交叉层冲突。在复合防御下,攻击成功率高达99.63%,且查询次数少于现有方法。这暴露了文生图模型安全机制的严重漏洞。

📄 REAL-Q:端到端 LLM 量化动态梯度下降

提出REAL-Q范式,通过细粒度的动态块梯度下降打破全局损失近似。在 LLaMA-3.1 和 Qwen3 上,端到端 KL 散度较最先进的全局引导方法降低约49%。该方法显著提升了低比特量化的模型性能和收敛速度。

𝕏 HarnessEvolve:解决自进化智能体三大失效问题的新研究

一项新研究提出HarnessEvolve框架,旨在解决自进化智能体在终端反馈模糊、模式记忆化和能力退化三大问题。该框架通过生成参考轨迹提取错误信号,并利用质量门和性能门双重过滤机制,确保更新仅在有提升时生效,显著提高了智能体的长期稳定性。

📄 GazeRefine:利用专家视线引导实现免训练的医学图像分割

GazeRefine 利用稀疏的专家视线作为推理时的提示,实现零样本医学图像分割。该方法无需标注掩码或微调,在结肠镜和前列腺 MRI 分割任务中表现优异,显著降低了标注成本,推动了医学影像分析的自动化进程。

📄 WM-RMoE:基于世界模型的自动驾驶风险感知决策框架

arXiv论文提出WM-RMoE**框架,利用世界模型进行多步轨迹推演,结合混合专家机制动态协调长/短期风险模块。实验显示在安全合规性和决策稳定性上显著优于基线模型,有效解决局部安全但长期高风险问题。

📄 SymFold:协同进化与结构先验的蛋白质逆折叠

提出对称双路径架构SymFold,结合 PLMs 的序列进化知识和 MPLMs 的结构知识。在标准蛋白质逆折叠基准上达到最先进水平,消融实验验证了对称设计的合理性。该成果显著提升了蛋白质结构预测的精度。

📄 Latent Recurrent Thoughts:冻结 LLM 的连续空间推理新方法

LRT 方法在保持大语言模型冻结状态下,利用小型循环网络生成连续潜在思维向量进行推理。在符号推理和自然语言推理任务中,以极小计算成本显著超越现有冻结解码器方法及非思考模式提示法。

📄 Inspicio:基于 LLM 的历史语言开放词汇词义检索

Inspicio 无需源语言词表即可将历史语言(如拉丁语、古希腊语)的词元链接到 Open English WordNet。在感知动词测试集上,Recall@50 达到96%,为历史语言学研究和古籍数字化提供了强大的工具。

📄 Right Frame, Wrong Rule:文化线索暴露金融知识缺口

研究显示,文化线索使大型开源模型选择伊斯兰金融框架的概率达97%,但在该框架内的正确率仅为34-43%(即57-66%错误),揭示了模型在特定规范下的能力盲区。这一发现强调了文化适应性在金融 AI 中的重要性。

📄 SCILAWS-BENCH:科学定律发现的基准

发布SCILAWS-BENCH,包含 118 个问题、291 个候选定律和约800 万真实数据点。实验发现预测拟合度可能与科学有效性背离,且记忆影响了模型是复述还是超越已发表公式的能力。该基准为科学发现类 AI 任务提供了重要评估标准。

📄 CoLT-Drive:自动驾驶长尾场景的反事实基准

推出CoLT-Drive基准,包含 3,536 个样本,用于评估自动驾驶模型对罕见物体的决策能力。提出的 KPA 框架在该基准上达到**60.8%**的对准确率,优于预训练 Qwen3-VL-2B 基线(50.3%)。

📄 HiveTraceGuard-Pro:紧凑型生成式护栏,俄语注入防御率达 99.9%

HiveTraceGuard-Pro 是基于 Qwen3-0.6B 微调的生成式护栏,在俄语提示注入召回率上达到0.999,中位延迟仅14.3ms,是同类模型中最低的。该模型在34个其他护栏的比较中,其俄语鲁棒性综合 F1 最高达0.88,展现了极高的安全防护能力。

📄 Making Prospective Memory SLM-Shaped:小模型的前瞻性记忆存储

提出Prospective Intention Store (PIS),将生命周期逻辑置于代码中。在 PM-Bench 上,DeepSeek-Chat 配合 PIS 达到**82.9%**的 Set-F1,超越了大型模型支架的 65.1%,证明了小模型在结构化空间下的潜力。该机制有效增强了小模型的长期规划能力。

📄 Contextual Sycophancy:多模态 LLM 的顺从性诊断

发现外部文本会覆盖冲突的图像证据,称为“多模态情境顺从”。提出S2VA(System-2 Visual Arbitration)方法,通过 withholding 文本来隔离视觉见证,使准确率提升19.7 至 44.1 个百分点。该研究揭示了多模态模型在处理冲突信息时的脆弱性。

📄 RePro:经证明验证的基准重写框架

提出RePro框架,集成 Lean 导向的自动定理证明器进行基准重写。实验显示,重写实例的 well-definedness、feasibility 和 answer correctness 均达到100%,有效解决了数据污染问题。该框架为构建高质量、可验证的 AI 基准提供了新思路。

📄 TopoAlign:利用代码库结构映射解锁数学 LLM 训练资源

TopoAlign将代码分解重组为类数学陈述,无需新知识注入即可使DeepSeek-Math在 BEq@10 指标提升17.77%,有效解决形式化数学语料稀缺问题。该方法通过代码结构映射挖掘潜在数学逻辑,为提升数学推理能力提供了低成本数据增强手段。

📄 HiLRP:为 Vision Transformer 提供统一的归因解释框架

HiLRP 解决了 ViT 架构多样性导致的归因方法失效问题,通过分解操作类型实现跨架构的守恒归因。在 14 种方法和 10 种架构测试中,其在 EfficientViT 上的指向性得分为0.97,远超竞品,为可解释性 AI提供了统一标准。

📄 Parsing the Stream:长周期智能体的实时追踪模型

提出实时追踪模型,将事件日志增量折叠为 typed run state。对于观察者,编译视图回答监控问题时输入 token 减少14-15 倍,成本降低5-7 倍,且准确率更高(0.85-0.87 vs 0.48)。该模型极大提升了长周期智能体监控的效率。

📄 TFMat:文本引导流匹配实现高效晶体结构生成

TFMat 利用结构化材料语言作为语义先验,指导 CrystalFlow 生成器。在 MP-20 基准上,使用20个候选者即可达到92.04%的匹配率,显著优于 CrystalFlow 基线,证明了文本引导在材料生成中的强大控制力。

📄 SLAE:叠加潜在自编码器,在相同存储下重建误差降低 56%

SLAE 通过叠加多个宽潜在表示来突破存储瓶颈,在 CIFAR-10/100 等数据集上,相比传统自编码器重建误差降低56%,下游分类精度提升16.79个百分点。该方法证明了“保持宽表示而非缩小维度”在表示压缩中的有效性。

📄 ViTAMINS:合成硬负样本提升自监督视觉 Transformer 训练

ViTAMINS 将合成硬负样本引入无监督预训练,在 ImageNet 及迁移学习任务中表现优异,ViT-B 模型性能超越 V-JEPA (ViT-L),分类精度提升最高达11.3%。该方法通过合成数据显著提升了自监督学习的效率。

📄 Visual Attention Faithfulness:视觉语言模型中视觉注意力的异质性

分析揭示了 VLM 中视觉注意力忠实性的三种模式:Faithful-Sufficient、Faithful-Distributed 和 Non-Focal。人工标注的真实区域仅在~60%的情况下满足完整性要求,揭示了视觉注意力的局限性。

📄 TimeSteer:联合音视频扩散模型中的推理时语音调度技术

TimeSteer 是一种训练-free 框架,允许在不微调骨干模型的情况下,精确控制联合音频 - 视觉生成中语音的起止时间。实验显示其显著提升了区间可控性,并发布了首个SpeechShift基准,填补了音视频同步控制的空白。

📄 DualStake:双路径置信度校准解决深度研究代理过度自信

DualStake 通过证据置信度和答案置信度的双重校准,显著改善了 Qwen2.5-7B 等模型在 8 个 QA 基准上的校准度,且不牺牲答案准确性。该方法有效解决了深度研究代理的过度自信问题,提升了AI 决策的可靠性。

📄 Zero-Shot Respiratory Sound Classification:LLM 增强的呼吸音分类

提出通过医疗 LLM 合成结构化报告来对齐自监督呼吸音编码器。在 9 个任务上达到61.3%的平均零样本 AUC,超越 CLAP 和 Qwen2-Audio,且仅使用全规模基线**43%**的数据量。这种方法显著降低了医疗音频分析的数据依赖。

📄 CARE:基于对比锚点的规范进化用于 LLM 后训练

CARE 框架利用前沿模型生成的高质量锚点响应,通过自适应分支修复奖励误设,通过追逐分支转化质量差距。在 WildChecklist-9K 等基准上,CARE 是唯一在 300 步训练中持续战胜 GPT-4.1 锚点的方法。

📄 Flawed in Nature, Perfect through Evolution:进化机制提升 AI 鲁棒性

提出“天生有缺陷,进化后完美”机制,通过让 AI 模型群经历定向突变来应对环境漂移。证明该机制能保证后悔率降低,在合成线性回归任务中,突变群在**80%**的环境变化中表现最佳。该研究为构建具有自适应能力的鲁棒 AI 系统提供了新视角。

📄 CASTER:无需梯度的冻结模型自适应方法

CASTER提出一种无梯度自适应技术,通过存储源类统计信息并执行仿射变换来适配目标分布。该方法无需反向传播或优化器状态,在ImageNet-C等数据集上比 k-NN 高出 27/28 的设置,且状态存储减少18 倍

📄 SciGram:基于术语的科学图表理解指令数据集

SciGram 包含19.4 万张科学图表和140 万条视觉指令。微调后的模型在 TQA、ScienceQA 等基准上达到 SOTA,证明了术语导向指令生成的有效性,为科学图表理解提供了丰富资源。

📄 NeuSOGA:从观察到符号数学表示的神经符号抽象

提出NeuSOGA框架,将观察转化为拓扑、几何直至符号数学表示。生成的表示具有任意阶光滑性,且保持可解释性和可编辑性,在 ModelNet40 点云上验证了其有效性。该框架 bridging 了感知与符号推理的鸿沟。

📄 MATCHA:音乐属性匹配的人类与计算机对齐数据集

MATCHA 包含1,105个由83名专家标注的音乐属性匹配案例,涵盖旋律、和声、节奏等五个维度。研究发现人类判断与计算相似度之间存在部分对齐,但也存在显著差异,为音乐 AI评估提供了新视角。

📄 StainPresetNet:快速多对多染色归一化网络,计算开销降低 90%

StainPresetNet 结合结构保持与数据集级颜色映射,无需重新训练即可适应多方向归一化。在细胞病理学和组织病理学数据集上,计算开销较现有深度学习方法降低90%,显著提升了病理图像分析的效率。

📄 Context-Grounding Gains:上下文 grounding 增益由预存机制介导

研究发现,SFT 和 DPO 带来的上下文 grounding 增益主要依赖于起始模型中已存在的因果注意力头集合。移除该方向会抑制增益,而添加它可恢复35%的 DPO 增益,揭示了上下文学习的内在机制。

📄 H2Table:层次超图增强的复杂表格推理

提出H2Table框架,将复杂表格表示为层次嵌套超图。在 HiTab 数据集上,H2Table 在处理深度为四的复杂表格时,平均准确率比最先进基线提升22.88%。该框架有效解决了二维表格结构信息的丢失问题。

📄 PLANET:超越图像平面的世界 grounded 多目标跟踪器

PLANET 通过将重建的 3D 场景几何嵌入特征和位置编码,实现了超越 2D 图像平面的多目标跟踪。在三个多样化基准上达到了 SOTA 性能,为自动驾驶机器人导航提供了更精准的感知方案。

📄 OmniEvaluator:可复现的全模态基础模型评估系统

发布OmniEvaluator系统,统一连接现有的推理引擎和评估库。该系统支持跨模态比较,记录了完整配置以确保可复现性,并通过联邦模式共享 GPU 资源,降低了评估成本。这为大规模多模态模型评估提供了统一平台。

📄 Disclosure-Gated User Simulation:改进伴侣代理评估的用户模拟

提出披露门控机制,根据代理行为动态释放信息,解决了模拟用户过度配合的问题。新模拟器在 CompanionBench 上与原始基准排名相关性达0.993,且绝对分数稳定,提升了人机交互评估的准确性。

📄 WiSDoM:6G 网络优化的无线稀疏决策 Transformer

提出WiSDoM框架,结合决策 Transformer 与混合专家架构,用于 6G 网络的多任务移动网络优化。该方法在提升用户体验(QoE)方面最高达55%,同时仅激活密集模型约三分之一的参数。

📄 Fault Localization vs Fresh Attempt:故障定位不如重试?

对照研究表明,在 26-32B 模型中,基于故障定位的修复成功率(**9.0%**可用谱)远低于盲法重采样。定位填充在匹配尝试次数下以3:40的比率输给了盲法重采样,挑战了传统的代码修复策略。

📄 REG 2025:自动化病理诊断与报告生成的视觉语言模型基准

REG 2025 基准基于约10,500对亚洲全切片图像 - 报告数据,评估了多种 VLM 方法。研究发现结构化报告表示和分层诊断分解是提升性能的关键,为病理 AI评估设立了新标准。

📄 ADGNet:非对称双文本引导红外小目标检测网络

ADGNet 设计非对称双文本提示,分别引导目标和背景,有效抑制红外噪声。在三个公开数据集构建的 AITIR 数据集上,超越了21种 SOTA 方法,显著提升了红外小目标检测的性能。

📄 Commit-first LLM judging inherits the judge's own errors:承诺式评判的固有缺陷

审计了 8 个主流评估框架的默认配置,发现无一实现有效的“承诺式评判”。实验表明,若评判者自身犯错,承诺式评判会将锚定效应转移到评判者答案上,导致评估失效甚至恶化。这一发现警示了当前自动化评估流程中的潜在风险。

📄 Probabilistic Model Checking:自回归神经序列模型的概率模型检查

提出了一种从自回归模型提取离散时间马尔可夫链的方法,用于验证形式化 PCTL 规格。在 GPT-2 案例研究中,量化了贪婪解码隐藏的概率质量,并识别了最小训练比例,为形式化验证提供了新工具。

📄 WHALE:联合优化模型权重与执行环境的简单配方

提出WHALE算法,交替更新模型权重和执行环境(Harness)。在搜索问答、数学推理和棋类谜题三个领域,相比单一优化方法,最佳 mean@8 准确率提升4.15-24.38 个百分点

📄 Distributed Implicit Harm:多模态视频审核的组合安全盲区

定义DIH现象,即由多个良性组件组合产生的隐性危害。构建了包含 9,000+视频的 DIH 数据集,发现包括前沿模型在内的 30 多种 MLLM 均存在严重缺陷,无法识别这种分布式隐性危害。

📄 RAEC:扩散语言模型的安全对齐新方法

针对扩散语言模型(dLLMs),研究提出Refusal-Aware Early Commitment (RAEC) 解码方法。该方法在LLaDADream模型上有效减少了攻击成功率,同时保持了模型的实用性,证明了早期拒绝信号的重要性。

📄 FoldingAgent:从演示视频推断参数化折纸程序

FoldingAgent利用视觉语言模型(VLM)和专用工具集,直接从折纸视频中推断可执行的参数化折叠程序。该方法通过模拟几何转换和验证物理合理性,成功将非结构化视觉演示转化为可执行计划,并在PurelandFold基准上取得突破。

📄 Activation-Matched Finetuning:检测 LLM 隐藏行为

提出无监督检测方法Activation-Matched Finetuning,通过微调公开锚点模型复现可疑模型的激活状态来检测后门触发、沉睡代理等隐藏行为。该方法无需先验知识即可可靠地暴露异常行为及其语义邻居。

📄 HarnessEvolve:基于参考轨迹的可靠代理自我进化框架

HarnessEvolve 通过生成参考轨迹对齐失败执行,解决了信用分配失败、捷径学习和灾难性遗忘问题。在多个基准上 consistently 优于 SOTA 基线,为代理自我进化提供了可靠框架。

📄 Semi-Supervised Virtual Staining:半监督虚拟染色保持形态真实

新方法利用有限配对数据和大量非配对数据,通过 Hessian 衍生的形态保持约束,实现了稳定的半监督虚拟染色。在 H&E-to-IHC 翻译任务中显著提升了图像质量和诊断性能,推动了数字病理学的发展。

📄 Interlingua Hypothesis:LLM 翻译机制的新证据

论文提出“通用语假说”,认为 LLM 通过潜在特征空间进行翻译。实验表明单语言微调可恢复大部分翻译提升,且 BLEU 方差主要由语言特定能力决定,为理解多语言模型内部机制提供了新视角。

📄 CacheBridge:高效的跨模型 KV 缓存转移技术

CacheBridge 通过架构索引映射器与支持注意力对齐的校准,实现跨模型 KV 缓存的高效转移。在 Qwen3 14B 到 32B 的转移中,存储减少 8 倍,应用加速 3 倍,且仅需十分之一的校准数据即可匹配 Full-Head Mapping 的精度。

📄 REVISE:基于有效性引导的智能体工作流在线修订恢复

Revise 框架通过交集 delta 与依赖传播,精细恢复智能体工作流中的无效工作。在 LangGraph 应用中,相比完全重启,模型调用减少 40.6-56.0%,显著提升了修订到正确完成的吞吐量,通过有效性引导减少智能体工作流修订开销

📄 EdiTikZ:基于修订轨迹的科学图表编辑

发布DaEdiTikZ数据集,包含78.1 万条指令,用于训练科学图表编辑模型。训练的 9B 模型在自动评估中优于所有基线,人工评估中与 GPT-5.6-Sol 相当,且在分布外偏移下仍具竞争力。这为科学可视化自动化提供了强大工具。

📄 Analog-DB:首个智能体优先的模拟集成电路数据库

发布analog-db,一个开源、版本控制的模拟 IC 数据库。包含 68 个电路,支持AI 设计代理直接发现和复用。在监督案例研究中,编码代理成功定位了手填缺陷和缺失反馈回路。这为 AI 辅助芯片设计提供了宝贵资源。

📄 Suicide Risk in Arabic Calls:阿拉伯语危机热线的自杀风险评估

分析了黎巴嫩国家生命线的去标识化阿拉伯语通话记录。最佳阿拉伯语模型在高危分类任务上达到81.19的 macro-F1 和90.61的 ROC-AUC,证明无需传输音频即可通过文本进行有效风险评估。

𝕏 G20 财长峰会因中国缺席未发表共识声明

贝森特在 G20 财长峰会后声明,会议立场除中国外基本一致。由于缺乏中国支持,会议最终未能发表正式共识声明,反映出国际经济合作中的分歧与博弈。

📄 WACI-HJ:面向边缘计算的 workload 感知哈希连接

提出WACI-HJ算法,通过预测查询负载提前计算分桶,加速边缘设备的哈希连接操作。在智能交通数据集上,缓存行读取减少54%,查询执行时间提升10%,CPU、RAM 和 I/O 效率分别提升 1%、38%和 49%。该研究有效解决了边缘设备资源受限下的数据处理瓶颈。

📄 Escaping Redundant Reasoning:结构感知的推理时搜索

提出 BASIN 方法,将推理状态分组并惩罚重复访问同一策略,从而在固定计算预算下重新分配搜索。在 Game of 24 和 MuSR 上,BASIN 分别比 ToT 提升 22pp 和 6.7pp,有效缓解了推理盆地坍塌,通过结构感知避免冗余推理

📄 SciTrue: Reliable Scientific Claim Validation with Frontier and Open Language Models

SciTrue 团队在 NTCIR SciClaimEval 任务中排名第一。研究发现,强指令微调模型已具竞争力,无泄漏配对先验(从标题恢复 Supported/Refuted 配对)将准确率从 72.2% 提升至 93.5%,远超模型替换效果。

📄 ChatDev 2.0:无代码多智能体开发平台

ChatDev 2.0 (DevAll) 是无代码平台,允许用户在不编写代码的情况下构建、执行和检查异构多智能体系统。它结合了声明性可执行图抽象与循环感知引擎,在三个代表性任务上复现了 SOTA 性能,提供无代码构建多智能体系统的平台。

📄 OCGQuant:NVFP4 量化中的离群值分组策略

提出OCGQuant方法,通过离群值 - 伴生分组(OCG)优化 NVFP4 激活块组成。在 Llama3 和 Qwen3 上取得了最低的 WikiText-2 困惑度和最高的下游准确率,同时保持接近 RTN 的预填充速度。该策略有效解决了低比特量化中的精度损失问题。

📄 ISO-RAG:等周噪声控制用于检索增强生成

ISO-RAG 将知识图谱投影到双曲庞加莱球,预计算节点等周轮廓以修剪虚假边。在多跳 QA 基准上,检索召回率绝对提升 10.0%,下游精确匹配提升 4.3%,消除了全局遍历的延迟瓶颈,通过等周噪声控制提升多跳 QA性能

📄 LifeAgentBench:首个长周期健康推理基准,22,573 题揭示 LLM 多维推理瓶颈

LifeAgentBench包含22,573道跨维度健康问答,涵盖长期规划、多步推理等复杂场景。该基准揭示了当前LLM在长周期健康推理中的多维瓶颈,为评估和改进医疗领域AI 代理的可靠性提供了重要标准。

📄 Formal Analysis of Agent Payment Protocols:智能体支付协议的正式分析

形式化分析了 x402、MPP 等四种代表性智能体支付协议。通过 Tamarin 验证发现了 40 个未文档化的形式一致性发现,并提炼出 18 个共享安全原则,强调委托授权必须与经济和服务效应保持一致。这为智能体经济系统的安全性提供了理论保障。

𝕏 JIT-Agent:按需生成 Agent 框架提升效率

新论文提出JIT-Agent,根据任务动态生成记忆、规划和工具框架。在 DeepSearchQA 上,DeepSeek-V4-Flash配合该框架得分85.1,比固定框架平均成本低36%

📄 trajectory-judge:结果导向 LLM 评判的盲点

指出结果导向评判无法检测“正确结果错误路径”的故障。实验显示,结果导向评判只能捕获**45%**的静默故障,而步骤规范评判能达到**77%**的静默召回率且无误报。这揭示了当前 LLM 评估方法在过程监控上的重大缺陷。

📄 Guardrails Look Effective:LLM 智能体商业评估中的构造效度失效

审计了多轮买卖测试床中的市场守卫规则。发现原始估计的福利增益在协议隔离下无效,受控研究显示生成残差占变异的49.9%,表明在通过严格检查前,不能断言守卫规则的价值。这揭示了商业场景中 AI 安全措施的评估陷阱。

📄 A Human-AI Theorem:连接自发与场诱导集体行为

证明了一个连接统计物理中零场自发集体行为与外场诱导行为的定理。该定理展示了人类与 AI 协作如何产生科学假设,并通过哈密顿量层面的映射,将复杂的 J1-J2 模型简化为标准的 J-h 场模型。

📄 The Curse of Multilinguality:词汇归一化中的多语言诅咒

研究发现多语言词汇归一化模型存在“多语言诅咒”:随着训练语言数量增加,单语言准确率下降约40%。控制数据总量后,这种下降源于固定容量模型中语言间的竞争,而非数据不足。

📄 Good Memory Has ECC:超越准确率的记忆评估基准

提出ECCBench基准,从效率(E)、压缩(C)和校准(C)三个维度评估 VLM 的记忆能力。发现预训练 VLM 虽能压缩文本记忆,但对视频记忆压缩效果差且校准不佳,非 Transformer 架构在压缩 - 校准权衡上表现更好。该基准填补了视觉语言模型记忆评估的空白。

📄 Agentic Cloud Engineering:零信任智能体云工程框架

提出Agentic Cloud Workflow Engineering框架,将自然语言云工程任务转化为验证的代码仓库和部署。实验显示,执行终止于经验证的云部署或可审计的终端失败,确保了工作流的受控执行和恢复。这为云基础设施的自动化管理提供了安全保障。

📄 EvoSCM:通过因果模型进化的科学信念修正

提出EvoSCM框架,赋予科学智能体显式的结构因果模型。智能体通过闭合发现循环,根据实验证据不断修正因果结构,在 DiscoverPhysics 基准上表现出更准确的解释和预测能力。这为构建具备科学推理能力的智能体提供了新范式。

📄 SAGE:通过熵选择智能体引导的自主学习

提出SAGE框架,仅在学习者不确定时查询 VLM 教师,并将指导蒸馏为轻量级 RL 策略。在稀疏奖励视觉推理任务中,SAGE 在无 VLM 指导的评估阶段表现优于未引导的 RL,且减少了VLM 调用次数。这种按需学习机制显著提升了效率。

📄 EDGE:多错误归因的错误依赖图

提出EDGE框架,构建错误依赖图并通过反事实 rollout 验证因果子集。实验显示,EDGE 在大多数评估模型和设置下改进了类别级的多错误归因,证明了依赖结构作为诊断先验的价值。这为多智能体系统的错误诊断提供了新方法。

📄 Drift-Aware LLM Routing with Sparse Contexts and Shared Budgets:漂移感知的稀疏路由

提出 DRS 策略,处理请求混合与模型前沿漂移的非平稳稀疏上下文路由问题。通过滚动审计窗口更新资源影子价格,DRS 在漂移条件下实现了优于静态选择的 regret 界,解决漂移感知下的LLM 路由问题

📄 LEAP:基于似然提取与聚合的概率预测

提出LEAP框架,单独评估每条证据并提取似然参数,再通过显式先验和概率模型聚合。在相同证据下,LEAP 在大多数预测和校准指标上优于单体预测设计,且保持了可复现的证据贡献。该方法提升了概率预测的透明度和准确性。

📄 GeoLAMP:复杂域 PDE 的几何感知自回归生成模型

提出GeoLAMP模型,利用双编码器架构捕捉图表示的全局拓扑和细粒度几何特征,解决微米级复杂几何下的多物理 PDE 求解问题。该模型在三个多物理基准数据集上保持了最稳定的自回归性能。

📄 FinLifeBench:从银行对话重建生活事件与金融状态

发布FinLifeBench,包含 6,000 个韩语银行会话,评估生命事件重建和金融状态重构。结果显示,随着会话数增加,事件锚点召回率从 0.591 降至 0.445,主要错误源于遗漏事件。该基准揭示了长程金融状态重建的挑战。

📄 InteractBench:未揭示信息下的编程竞赛基准

发布InteractBench,包含 322 个交互式编程问题。评估显示,即使是先进的推理模型在交互式问题上成功率也有限,主要失败原因为协议违规和查询预算超支。该基准突显了智能体在复杂交互环境中的适应性挑战。

📄 CoBRA:通过反事实边际学习工具使用边界

CoBRA 框架构建内部与外部专家,估算工具使用的边际收益以划分数据。通过边界感知冷启动 SFT 与 MARS-RL 优化,在 Qwen3-4B 上显著提升了工具使用效率与边界敏感的答案准确率。

📄 CompanionSim:评估人机关系中拟人化的合成数据

发布CompanionSim框架,包含 2,240 条模拟对话,用于评估 AI 伴侣的拟人化影响。研究发现,伴侣行为反而降低了用户对 AI 的可信度和喜爱度,尤其在女性和老年群体中更为明显。

📄 Residual Sparsification via Output Importance for Compressing MoE LLMs

PARSER 方法通过输出重要性将压缩目标从最小化矩阵误差转向保留专家输出误差。在 Qwen 和 DeepSeek 上,PARSER 将压缩后的准确率差距缩小 1.41-1.44 倍,同时保持相同的峰值内存减少,通过输出重要性优化MoE 模型压缩

📄 Dependency-Aware Chain-of-Thought Compression for Financial Reasoning

HSDN 框架压缩思维链同时保持逻辑连贯性。在 AFAC2025 基准上,HSDN 以 68.4% 的压缩率保持 91.0% 的准确率,优于强压缩基线,证明了图引导压缩在高 stakes 金融推理中的有效性,实现思维链压缩并保持金融推理准确率

📄 ContextPipe:数据库启发的长程智能体上下文组装

ContextPipe 将上下文组装类比为数据库查询执行,采用五阶段管道与确定性缓存优化器。在 SWE-bench Pro 上,相比追加策略,Token 总量减少 31%,LLM 调用减少 23%,响应时间减少 9%,有效优化了长程智能体上下文组装

📄 Triple-Bottom-Line Sustainability of Language Models for Edge AI:SLM 与量化 LLM 的可持续性对比

引入 Holistic Sustainability Score (HSS),从经济、环境、社会三维度评估边缘 AI 模型。结果显示,优化的量化 LLM(如 Qwen3-30B/GGUF Q4)在某些场景下优于原生 SLM,表明量化是系统级选择而非单调权衡。

📄 Validity-Aware Jailbreak Evaluation for Large Language Models

SEAV 框架分解响应为有序步骤,评估有效性与正确性。实证显示,SEAV 将 SD-A 基准的假阳性率降低 14.9pp,并将 22.1%-51.0% 的先前标记成功重新分类为无效,重塑了鲁棒性测量,通过有效性感知大幅降低越狱评估假阳性。

📄 SOVER:LLM 辅助的 SMT 验证优化重构形式认证

SOVER 框架分离语义映射与形式认证,利用 Z3 和 dReal 验证混合整数与非线性公式。在 NLEquiv-150 基准上,SOVER 正确分类了 149/150 对等价与不等价重构,包括所有 50 个困难负例,实现了优化重构的形式认证

📄 Do General NLP Embeddings Capture Ontological Reasoning?:通用嵌入的本体推理局限

通过AVA框架评估 25+种 NLP 嵌入模型的本体推理能力。结果显示最佳模型仅在三元组准确性上达到 0.739,而在硬负例上仅为 0.135,揭示了语言表征学习本体级判别之间的巨大差距。这表明当前通用嵌入在深层逻辑推理方面仍存在显著不足。

📄 SAGE:任务导向对话智能体的状态接地、弃权评估

SAGE 编译工作流规范为原子标准,通过符号与编码器验证器进行状态一致性评估。SAGE-Core 在零付费 LLM 成本下决定 81-91% 的标准,性能与昂贵的 GPT-4.1 相当,零成本实现任务导向对话状态评估

Motional 与 MIT 合作研发自动驾驶实时解释系统

MotionalMIT研究人员在 Nature发表论文,提出 CW-Net系统,可将自动驾驶神经网络的内部逻辑转化为人类可理解的概念(如“靠近骑行者”)。该系统实现了实时决策解释,解决了自动驾驶“黑盒”问题。

📄 Attention Sensitivity Is Not Enough:解耦注意力与行为上下文学习

指出注意力敏感度作为上下文学习代理的局限性。实验显示,最大化注意力敏感性的正则化器并未改善行为准确率,反而导致 MMLU 准确率从 0.371 降至 0.279,揭示了注意力代理行为读数的脱钩。这表明单纯优化注意力机制不足以提升推理能力。

📄 Retrieval, Scoring, and Decoding:LLM 推荐系统的性能稳定性

在 ReDial 基准上测试 LLM 重排序器,发现性能高度依赖于候选池大小和解码温度。当切换为协同过滤候选时,最佳专有重排序器的 NDCG@10 提升超过50%,表明评估报告需包含这些关键配置。研究强调了评估设置对结果一致性的决定性影响。

📄 Towards reliable multimodal disaster severity assessment:基于偏好优化的灾难评估

提出结合 SFT 与 DPO 的两阶段训练框架,从人工标注工作流推导 ReasoningSet 与 PreferenceSet。实验显示,SFT 将准确率提升至 78.29%,解释质量提升 25%,DPO 进一步增强了可解释性与对齐度。

📄 DramaChain Bench:短剧生成的端到端基准测试

DramaChain Bench 评估短剧生产链的每个阶段(剧本、分镜、视频等)。包含 5,785 项人工评分,证明上游缺陷会级联影响最终质量,且视频生成并非唯一决定因素,需全流程评估,揭示短剧生产中上游缺陷的级联效应

📄 GUI-CC:GUI 世界模型的上下文一致性基准

发布GUI-CC基准,评估 GUI 世界模型作为智能体环境的上下文一致性。实验表明,合理的单步生成并不保证可靠的环境模拟,现有模型常无法保留任务相关上下文或支持可执行的多步 rollout。该基准推动了 GUI 智能体环境模拟的发展。

📄 TPGC:多任务图预训练的任务特定提示与全局上下文

提出TPGC双先验提示初始化方案,显式建模任务先验与结构先验的协同作用。在 6 个主流基准的少样本设置下,TPGC consistently 优于最先进基线,且下游可调参数更少。该方案有效提升了图神经网络在少样本场景下的泛化能力。

📄 Behaviorally Grounded User Profiles:基于行为的个性化对齐

提出从真实社交媒体帖子中提取开放式的用户画像。在复杂推荐和开放式查询基准上,行为 grounded 画像 consistently 优于合成画像基线,驱动更强的参数化对齐和多视角推理。这为构建更真实的个性化推荐系统提供了新方向。

📄 Reinforcement Learning Enhanced LLM Agents for Complex Vehicle Routing Problems

RLEA 框架结合软 Q 学习轻规划器与演化记忆模块,自动化复杂 VRP 建模。在 48 种 VRP 变体上,RLEA 成功率高出 SOTA 16.67%,显著减少运行时错误,验证了 RL 与 LLM 推理结合的有效性。

📄 DISTAL:结构无关的材料属性预测蒸馏框架

提出DISTAL框架,结合自监督成分预训练和结构感知知识蒸馏。在 39 个基准任务中,最佳多模态配置在 37 个任务上优于参考基准,实现了在小数据条件下仅凭成分信息的鲁棒预测。这为材料科学中的快速筛选提供了新工具。

📄 Life Operators:多尺度生命建模的自演化框架

提出Life Operators框架,通过感知、演化和生成算子构建医学 AI 的模块化结构。该框架支持科学假设的局部修订和累积,为医疗人工智能超级智能提供了计算基础。这一框架旨在实现更具适应性和可进化的医疗诊断系统。

📄 Dual Process Motion Planning:双过程运动规划

提出双过程架构,结合符号求解器(System-2)和经验驱动模块(System-1)。元认知控制器动态协调两者,在非线性基准环境中实现了规划效率、准确性和泛化性的一致提升。这模仿人类思维模式优化了机器人控制策略。

📄 Prompt-Robust Language Models:提示鲁棒性的训练策略

复现并比较了多种提示鲁棒性微调策略。发现尽管新方法优于标准微调,但最佳与最差提示的性能差距仍高达40-57%,且简单的单模板数据构建策略往往优于复杂的辅助目标方法。这表明提示鲁棒性仍是待攻克的难题。

📄 AnalysisBank:金融报告生成的专家分析模式库

AnalysisBank 从 550 份专家报告中提炼分析模式库,将数据信号与分析动作配对。在两个金融基准上,该方法使新颖数据驱动洞察的比例提升 1.7-3.7 倍,超越了基于结构的基线。

𝕏 ADeptS-Bench:计算机使用 Agent 的安全隐患暴露

ADeptS-Bench 测试显示,所有7款主流模型均无法识别恶意 GUI 操作(如误点击导致工厂重置),攻击成功率超过80%。研究指出安全机制需从模型层扩展至包装层。

📄 Lingua Franca or Probing Artifact?:多语言 LLM 中的潜在语言争议

研究了不同探针在多语言 LLM 中识别潜在语言的一致性。发现基于隐状态几何的探针与基于解码的探针结果存在系统性分歧,表明当前探针可能测量的是不同的计算方面,而非单一的内在通用语。这一发现对多语言模型的内部机制解释提出了挑战。

📄 HEAL:无强化学习推理蒸馏框架,突破教师模型天花板

HEAL引入后验熵辅助机制,通过 GEAR 模块修复断裂推理轨迹,在多个基准测试中显著优于传统 SFT 蒸馏方法,解决复杂案例无法探索的问题。该框架摆脱了对强化学习的依赖,为知识蒸馏提供了更高效的路径。

📄 RAPIDMap:灾难地图生成的快速多智能体流水线

提出RAPIDMap流水线,整合灾害感知、图像恢复、损伤识别和地图生成四个智能体。该框架无需手动微调,即可从卫星和街景图像中生成结构化的灾难情报和恢复建议。这为应急响应提供了高效的自动化分析工具。

📄 Fed-LSVI:联邦强化学习的对数通信成本算法

提出Fed-LSVI算法,通过行列式触发同步和逐步向后更新机制,仅需交换压缩的充分统计量。该算法实现了理论上的 regret 界,并将通信成本降低至关于 episode 数量的对数依赖

📄 Topic Matching in the Wild:真实 ASR 转录的主题匹配基准

构建基于真实呼叫中心 ASR 转录的主题匹配基准,对比正则表达式、嵌入编码器和Gemini-based LLM匹配器。实验表明,配备自然语言描述的轻量级LLM匹配器性能优于嵌入和正则模型。

📄 Latent-Space No-Arbitrage Geometry:生成模型隐含波动率曲面约束

研究生成模型潜在空间中满足静态无套利约束的几何特性。通过分析潜在代码的边际值,确定了允许区域边界,并提出水平集方程描述其动力学。该方法适用于 VAE、GAN 等多种架构,可用于修正违反约束的潜在代码。

📄 Spawn Freely, Act Sparingly:递归 LLM 智能体树的渐进式风险归属

提出 PRV(渐进式风险归属)机制,在递归智能体树中持有轨迹级风险预算。理论证明,在沙盒中广泛搜索并谨慎授予行动权限的设计规则,能有效控制轨迹危害,避免局部风险估计失效导致的灾难性后果。

📄 Cleaner Speech, Weaker Generalization:阿尔茨海默症检测中的语音预处理陷阱

重新评估了用于阿尔茨海默症检测的语音预处理和数据集策展的影响。实验发现,经过增强的“更干净”语音数据集虽然提升了域内性能,却导致跨域泛化能力显著下降,提示“干净”数据未必更可靠。

𝕏 马尔代夫成西方物资经俄暗道,价值数亿美元

华尔街日报》独家报道,马尔代夫已成为一条关键运输路线,源源不断将价值数亿美元的西方物资输送至莫斯科。这条未被报道的路线表明俄罗斯突破西方限制的努力极其广泛。

📄 Conversation Coach:语音驱动的 AI 系统帮助练习困难职场对话

Conversation Coach 系统支持管理者进行语音演练。端到端语音转语音模型实现 3 倍低延迟与 8 倍低成本,而级联架构提供更优推理。生产部署显示 40,000+ 管理者使用,主要用于困难对话,通过语音演练提升管理者沟通技巧。

📄 WorldBench:文化 grounded 的多语言智能体基准测试

WorldBench** 包含 1,600 个跨七国八文化的任务,评估智能体在多语言场景下的状态保持与任务完成能力。实验显示,前沿模型仅达到 49.2% 的约束任务成功率,暴露出当前智能体在长程多语言任务中的脆弱性。

📄 Medical Causal Hypothesis Verification:LLM 验证因果假设的可靠性

评估 8 个 LLM 在验证医疗因果假设方面的表现。虽然召回率高,但模型常无法提供有效的科学文献支持或拒绝不支持的假设,表明目前 LLM 尚不能完全信任用于医疗领域的因果验证。这强调了在高风险领域应用 LLM 需谨慎。

📄 CoVer:冲突感知的主张验证

ContraNote 数据集包含 33,686 篇帖子CoVer 框架通过三阶段流程(规范化、共识、验证)优先处理证据。在冲突与优先级任务上,CoVer 均取得 SOTA 性能,有效防止噪声干扰最终裁决,通过冲突感知提升主张验证准确率。

📄 论文研究:Code-CoT 实现多模态几何推理的可归因学习

研究人员提出Code-CoT方法,将视觉关系表示为可执行的代码,并通过CE-GRPO算法选择事件边界。该方法在九个几何基准测试中平均准确率达到76.04%,优于 Qwen3-VL-8B 和轨迹级 GRPO 模型,展示了表示优化与协同设计的价值。

📄 SpecMind:多智能体混合检索增强生成赋能频谱智能

SpecMind 系统协调子代理检索并综合政策、法律与许可证数据。在 SpecBench 基准上,SpecMind 以超过 80% 的胜率击败传统 RAG 系统,实现了更准确的检索与上下文推理,通过多智能体 RAG提升频谱智能

📄 SARTM:结合语言引导的 RGB 热成像分割模型,多模态一致性显著提升

SARTM通过 LoRA 微调 SAM 并引入跨模态知识蒸馏,在 MFNET、PST900 等基准上显著优于 SOTA,有效解决光照恶劣条件下的语义分割难题。该方法增强了RGB热成像的多模态一致性,提升了复杂环境下的感知能力。

📄 VIBE-Bench:评估个人化 LLM 在档案与偏好概念错位时的表现

VIBE-Bench 包含 3,504 个人设与 12,239 次对话,专门测试档案 - 偏好概念错位(PRCM)场景。实验显示,当前个人化 LLM 严重依赖浅层语义匹配,无法在跨概念空间中建立稳健映射,导致个性化失效。

📄 VoiceLongMemEval:助手是否记得你的声音?

VLME 基准评估助手对语音副语言元数据(情感、韵律)的记忆。实验显示,提供文本轨道副语言元数据可将准确率提升 0.09-0.38,而标准 ASR 管道系统性地丢弃了这一关键信号,揭示助手在长程对话中遗忘语音副语言信号

📄 FLaG:频域潜在注意力门控池化用于 Token 聚合

FLaG 模块在傅里叶域重表达编码器输出,通过可学习潜在查询总结谱 Token。在 AMP 活性预测、图像分类及语言任务中,FLaG 取得了最佳的宏观 Spearman 相关系数与 Top-1 准确率,展示了频域聚合的迁移性。

📄 Same Request, Different Boundary:评估网络安全协助在对话上下文中的表现

3R-Bench 评估 LLM 在网络安全请求中的拒绝行为。发现历史对话强烈改变响应:接受历史后合规率从 62.0% 升至 85.1%,而拒绝历史后降至 50.1%,表明对话历史显著改变网络安全请求的合规率。

📄 Self-Reports Are Not Verification:环境接地审计 LLM 操作者

提出环境接地审计方法,发现智能体自评严重高估成功率(4.8-9.3 倍)。置信度校准与判别力在不同模型家族间解耦,证明不能将智能体自报告视为可靠性证据,必须通过环境验证,审计显示智能体自报告严重高估成功率。

📄 Data-Driven Persona-Conditioned Agents:用于 A/B 测试模拟的数据驱动型人设智能体

提出基于匿名行为数据的数据驱动人设智能体,用于 A/B 测试模拟。在 40 个 A/B 测试基准上,最佳配置达到 0.75-0.90 的方向准确率,证明了利用真实行为信号进行低成本实验预筛选的可行性。

𝕏 研究发现 ERBB4 蛋白异常表达或为阿尔茨海默病早期驱动因素

韩国基础科学研究院在 《自然》发表研究,发现本该在抑制性神经元表达的 ERBB4蛋白在兴奋性神经元异常表达,是阿尔茨海默病的早期驱动因素。该发现为治疗该疾病开辟了新视角。

📄 Towards a Belief-Based World Model for LLM Agents

提出 BB-WMs(基于信念的世界模型),显式建模当前状态的已知与不确定信息。实验表明,向 LLM 智能体暴露世界模型的信念能显著提升部分可观测环境下的任务性能,补充了现有的模拟方法,通过暴露信念提升部分可观测任务性能。

📄 ValueGraph:价值信号引导的图预训练框架

提出ValueGraph,利用推断的道德价值信号作为辅助噪声信号进行用户表示学习。在立场检测和 Twitter 机器人检测任务中,一致优于强文本和图基线,证明了价值信号作为归纳偏置的有效性。该研究探索了伦理因素在机器学习中的应用。

📄 Value Over Language Model:检测写作中的原创贡献

提出 VOLM 框架,测量人类在 LLM 可轻易生成的内容基础上增加的价值。该方法无需训练或标签数据,通过比较部分表示的重构差异,有效区分人类-authored 文档与 LLM 生成的文档,量化人类写作的原创贡献

📄 论文:AI 应提供“条件性”反馈而非盲目顺从

新论文提出Contingency(条件性)概念,指出当前对齐方法倾向于用户满意度和对话流畅性,导致 AI 产生阿谀奉承模式。研究建议评估 AI 不应仅看满意度,而应考察其对人类社交学习的影响,特别是青少年群体的适应性校准。

📄 StudyBench:自我进化能否压缩教科书以获得奥林匹克能力?

StudyBench 基准直接测量自我进化方法将训练材料转化为能力的效率。研究发现,应用集的提升很少转化为更难迁移集的进步,且所有方法均在耗尽计算预算前遇到计算平台期,表明这是方法问题而非数据或计算问题。

📄 Weight of Evidence:特征重要性解释的稳健性评估

引入基于证据权重的假设检验框架,评估特征重要性方法(FIMs)的一致性与对齐度。该方法不仅量化了 FIMs 与先验知识的对齐程度,还通过理论推导链接了证据权重与归因方差。这为理解模型决策的可解释性提供了更严谨的数学基础。

📄 Automated Event Log Generation:利用微调 LLM 生成事件日志

提出利用微调 LLM将非结构化文本转换为结构化事件日志的框架。结果表明,微调方法比 few-shot 或 zero-shot 提示法大幅提升精度,为流程挖掘生态系统扩展了可用数据源。这解决了工业界事件日志获取难的问题。

📄 Figures as Programs:递归生成可编辑的科学图表

FigTree** 系统将科学图表生成视为递归 SVG 程序构造,通过多智能体协作将论文内容转化为矢量图。渲染 - 批评家细化循环可精确定位视觉缺陷并修复,相比光栅方法提供了更高质量的图表与更强的可编辑性。

📄 One Policy, Any Budget:通过强化学习内化预算感知搜索

AnySearch 框架使单一策略能在任意预算约束下执行预算感知搜索。通过课程强化学习与复合奖励函数,该方法在七个基准上表现出优异的泛化能力,无需额外 token 开销即可实现卓越的工具生产力。

📄 ML/AI 应用能源与碳影响评估清单

提出了一套实用的检查清单,帮助地球系统建模领域的研究人员评估和减少 ML/AI 应用的能源消耗和碳足迹,涵盖了从模型开发到部署的各个阶段。该清单旨在推动绿色 AI的发展,减少环境影响

📄 论文:LLM 在自动驾驶中继承人类驾驶员偏见

研究发现LLMVLM在行人让行决策中存在基于性别、种族、宗教等因素的偏见。研究提出了“一切皆同”和“自洽性”两种新的偏差测试方法,揭示了通用常识模型在自动驾驶伦理评估中的潜在风险。

📄 Denoising Diffusion Generative Models Secretly Calculate Attentions:扩散模型隐含注意力机制

证明去噪扩散模型本质上使用类似 Transformer 的注意力机制,表明注意力是通用机器学习原则。基于此发现,提出基于注意力的简化图像生成算法,在保持性能的同时显著降低训练与计算成本。

𝕏 AgentFold:闭环搜索驱动蛋白质折叠模型设计

斯坦福等高校提出AgentFold,通过代码快照搜索优化蛋白质折叠模型。该闭环 Agent 在 ESMFold 搜索任务中击败了独立 Codex 提案,实现了科学发现的自动化迭代。

📄 Measuring Behavioral Fidelity:长周期人类活动模拟的行为保真度

建立框架评估长周期人类活动模拟的行为保真度。研究发现统计先验使活动分布最接近真实行为,但过度碎片化了常规并抑制了个人变异性,呼吁更全面的评估体系。这为构建更真实的社会模拟环境提供了指导。

📄 Verifiable Disaster Storylines and Causal Knowledge Graphs:基于引用的灾害故事线构建

提出结合 EM-DAT 结构化记录与 ReliefWeb 非结构化文档的管道,生成带引用溯源的因果知识图谱。人工评估显示,该方法具有高检索精度与强忠实度,专家偏好于带引用的组件。

📄 The Privacy-Hallucination Tradeoff in Differentially Private Language Models

揭示差分隐私(DP)语言模型中存在隐私 - 幻觉权衡:隐私预算越严格,幻觉越严重。DP 机制扁平化输出分布,将概率质量重分配至事实错误选项,需在隐私保证与事实准确性之间寻求平衡。

𝕏 俄罗斯乌兰乌德因战争奖金催生“繁荣”假象

高额入伍奖金和阵亡抚恤金使俄罗斯城市乌兰乌德出现新公寓、商铺涌现的繁荣景象,但当地公墓新坟也越垒越多。《华尔街日报》深入探究了“战争财”如何重塑当地经济结构与日常生活。

📄 无训练代理模型用于神经放射学图像分析

展示了一种无需训练的Agentic AI流程,利用现有 LLM(如 GPT-5.4)配合专用工具,自主完成脑部 MRI 分析的预处理、分割及体积推理。该方法无需微调即可解决复杂放射学任务,证明了零样本学习在医疗影像处理中的巨大潜力。

📄 论文:SCAFFOLD 数据集包含 15.7 万张 CS 论文图表问答

研究者发布了SCAFFOLD数据集,包含157,387对图文问答及思维链推理轨迹,覆盖3,058篇计算机科学研究论文。该数据集填补了视觉 - 语言模型理解科研图表的空白,有助于训练模型解析架构图和流程图。

📄 分层赫布记忆架构用于持续视觉 Transformer

提出Hierarchical Hebbian Memory架构,包含工作记忆、路由情景记忆和语义记忆三层,有效解决 Vision Transformers 在持续学习中的经验组织问题。该结构解决了ViT难以组织不同时间尺度新信息的难题,在 Omniglot 和 CORe50 数据集上取得了高精度表现。

📄 ES-AHD:进化策略与大语言模型结合的自动启发式设计框架

提出ES-AHD框架,将**进化策略 (ES)大语言模型 (LLM)**结合用于自动启发式设计。通过语义重组和随机协方差自适应,显著加速高质量启发式算法的生成,源码已开源。该方法展示了AI在算法设计领域的自动化潜力,为复杂优化问题提供了新的解决路径。

📄 EGT-KG:证据支撑的类型化知识图谱检索用于科学问答

EGT-KG 框架改进本地 SLM 的信息检索。在生物聚合物土壤复合材料基准上,EGT-KG 优于 vanilla RAG,llama3:8b 的最终得分提升 14.67%,证明了证据支撑的知识图谱在小模型科学问答中的有效性,提升小模型科学问答的准确性。

📄 论文:FAIRY 全栈智能农业代理系统在黄豆农场部署

FAIRY 系统集成了 API、传感器、无人机和卫星数据,实现了从整地到收获的全季程自动化管理。该系统在哈尔滨理工大学农场部署,评估了9种先进代理控制器在100个全季黄豆场景中的表现,验证了事件驱动范式的有效性。

📄 UMA:端到端记忆代理训练,解决长上下文推理状态追踪难题

UMA构建查询无关的外部记忆库,通过 Task-Stratified GRPO 监督记忆维护,在 16k 预算下于多项长程状态追踪基准取得最高平均分。该方法通过外部记忆库机制,显著提升了长上下文推理中的状态追踪能力。

📄 Wave Function Backpropagation with Explicit Temporal-Interval Dynamics

提出 WFB 学习公式,用可学习的波参数(振幅、波数、频率、相位)表示神经响应。在运动特征下,STD-WFB 将平均位移误差降低 20.4%,证明了波表示在时序学习中的有效性,通过波参数提升时序学习性能。

📄 S^3martCirc:自监督智能电路发现

S^3martCirc 框架同时发现电路并解释功能,将节点行为抽象为通用计算角色。实验显示,该方法在电路发现任务上优于现有方法,解决了功能角色与重要性识别相互依赖的挑战,实现了电路发现与功能解释的统一。

📄 Inverted Contrastive Learning for Unsupervised Feature Selection:特征层面的对比学习

提出 ICLFS 方法,将无监督特征选择重构为特征层面的表示学习问题。通过反转数据矩阵并在投影空间学习一致性,ICLFS 在 12 个基准数据集上取得了最佳的聚类准确率,优于传统方法。

𝕏 JD·万斯警告犹太裔共和党人警惕年轻一代对以怀疑情绪

美国副总统 JD·万斯向犹太裔共和党人发表闭门讲话,警告 40 岁以下美国人对以色列的怀疑情绪日益滋长。外界认为他可能参加 2028 年共和党总统提名竞选,其对美以关系的批评态度已引起捐款人担忧。

📄 Socrates went Nuclear:脑传感比较 AI 系统在学习环境中的交互策略

比较 unrestricted chatbot、Socratic mode 与自适应辅导系统。结果显示,无限制聊天机器人带来更高的学习增益,但自适应条件产生了更高的 EEG 参与度,表明无限制 AI的学习增益可能源于即时评估而非深层学习

📄 VGEBench:通用视觉 grounding 家庭设备探索基准

VGEBench 评估 VLM 在无手册情况下操作新设备的通用视觉 grounding能力。通过逻辑驱动状态机模拟多轮交互,发现现有 VLM 在将语义知识转化为物理执行及维持长程状态跟踪方面面临重大挑战。

📄 ProMem:主动式记忆提取框架,提升 LLM 代理长期交互质量

ProMem分离细节、事件与关系提取策略,并通过原子级事实验证减少幻觉,实验证明其显著提升了记忆完整性和问答准确率。该框架通过主动记忆管理机制,有效解决了长上下文交互中的信息丢失和幻觉问题。

📄 Feedback-Assisted Trust Propagation over Document Relation Graphs for RAG

TrustPropRAG 将文档关系结构化,通过多跳传播估计文档可靠性。利用有限的用户反馈作为锚点,该方法在稀疏和噪声反馈下仍能显著提升检索质量与精确匹配率,通过信任传播提升RAG检索质量

📄 Agentic Empirical Asset Pricing:代理实证资产定价的方法论基础

定义 AEAP 范式,即系统自主进行科学发现过程。提出因子发现的参考架构与评估标准,强调不仅评估输出结果,还需评估发现系统本身的可靠性,并报告了负向发现与评估陷阱,重点关注代理发现系统的可靠性。

📄 RPCBench:LLM 推荐系统中主动前提批判的基准

RPCBench 评估推荐助手识别 flawed premise 的能力,包含五种推荐领域与十种前提故障类型。实验发现,主动检测是主要瓶颈,且中等长度的推理表现最佳,过长推理反而引发过度思考惩罚。

📄 Polished but Unresolved:识别长程工具使用智能体的晚期压力状态

发现智能体在提交最终答案前存在晚期压力状态,倾向于提交看似完整但关键约束未解决的方案。提出 PSPR 插件,通过轻量级压力缓解方向干预隐藏状态,有效增强了现有智能体方法的鲁棒性。

📄 Closed-Loop Evaluation of Capability Loss and Recovery in Compressed Driving Policies

提出分阶段闭环评估方法,追踪驾驶策略在压缩管道中的能力变化。研究发现结构化剪枝是能力首次丧失的阶段,而量化后的恢复能力取决于是否经过剪枝,为自动驾驶策略的安全部署提供了实证分析。

📄 CM-PTM:跨多源行为预训练用于移动游戏用户表征

提出 CM-PTM 模型,在设备层级统一建模跨源依赖与细粒度行为动态。通过在大规模真实移动数据集上的实验,证明该方法能有效捕捉用户内生兴趣,显著提升下游移动游戏推荐任务的性能。

📄 In-Context Neurofeedback:LLM 能否通过特权访问控制内部表示?

重新设计满足特权访问要求的神经反馈范式,发现 LLM 无法可靠控制内部表示。这表明先前报告的“控制”可能依赖于表面机制,严谨的元认知评估必须要求真正的特权访问。

📄 论文:长视界状态追踪挑战:MD5 哈希计算测试

一项新测试要求 LLM 通过196次依赖工具调用完成MD5哈希计算,以评估长序列状态追踪能力。gpt-oss-120b模型在特定设置下成功携带完整状态并返回正确摘要,揭示了上下文保持和投票机制对长任务成功的关键作用。

📄 论文:Phi-4 和 LLaMA-3.2 在小模型金融诈骗检测中表现优异

研究针对老年人金融诈骗构建了多轮对话数据集,发现微调后的Phi-4LLaMA-3.2在小参数规模下能捕捉欺诈相关的语言线索和跨轮升级模式。该框架支持增量风险评估,适合移动端和隐私保护场景部署。

📄 Automated Tree Knowledge Graph Construction using Ontology Expansion:越南历史教科书知识图谱构建

提出端到端管道,利用本体扩展从越南历史教科书中构建树状知识图谱。树状知识图谱结构信息在检索中具有独特价值,Top-Down 遍历策略在 NDCG@10 上超越向量基线 4.7 个百分点,显著提升RAG 检索性能

𝕏 Prometheus Inc 招募全球人才构建物理世界通用智能

Prometheus Inc 创始人宣布在苏黎世、旧金山和伦敦招聘,致力于构建面向物理世界的通用工程师智能。团队聚焦于加速从想象到发明的循环,被视为 AI 行业的新前沿,能量堪比 Google Brain 和 OpenAI 早期。

📄 QILP-0:构建量子电路的观察声明孪生体

提出 QXymb 框架及其子集 QILP-0,从观测到的量子电路行为构建有限多值命题逻辑程序。在 16 至 100 量子位的实验中,QILP-0 理论实现了完全无冲突的重建,准确率达到 100%。

📄 论文:HyperWorld 超图结构序列化提升文本世界模型

研究对比了不同状态序列化方式,发现超边(hyperedge)序列化在中小规模模型(0.5B-1.5B)和分布外测试中表现最佳。该方法通过实体中心化的事实分组,提高了世界模型的可行性检测和效果预测能力。

📄 MaSoN:无监督遥感变化检测新框架,F1 分数提升 14.1 个百分点

MaSoN在潜在空间合成多样化变化,无需预定义假设即可泛化至 SAR 和多光谱数据,在五个基准上平均 F1 分数提升14.1%。该框架通过无监督学习解决了遥感图像变化检测中样本稀缺的难题。

📄 论文:I-CARE 方法论用于分析生成式模型遗忘干扰

I-CARE 正式定义了生成式机器遗忘中的“干扰”现象,即移除知识时意外退化相关概念的问题。该框架提供了标准化的任务定义、指标和报告模板, enabling systematic study of interference across unlearning settings without requiring code interaction.

📄 神经符号回归:深度学习与稀疏建模的结合

提出 Neural Symbolic Regression (NSR) 框架,利用神经网络学习平滑近似,再通过 LASSO 提取稀疏可解释表达式。实验显示该方法在噪声鲁棒性和分布外泛化能力上优于 SINDy 等传统方法,实现了深度学习符号回归的有效融合

📄 PosEDO:基于后验辅助进化动态优化的黑盒社会模拟器校准

提出 PosEDO 框架,用于在线校准黑盒模拟器。该方法结合进化动态优化与后验分布信号,通过参数轨迹对模拟器的变化进行检测和适应,在非平稳经济和金融模拟器实验中显著提升了校准精度,为复杂系统建模提供了新工具。

📄 When the Algorithm Becomes the Brand Crisis:分布式责任与问责透明度的社会技术理论

提出社会技术过程理论,区分 AI 事故、组织危机与丑闻。框架表明,事故配置塑造责任归属,进而影响利益相关者的评价,并提出问责透明度作为应对 AI 品牌危机的配置方案,解析AI 品牌危机中的责任归属

📄 Consistency Without Alignment:项目敏感的语言模型与随机无异

发现尽管模型表现出项目敏感性,但在某些评估中其表现与随机选择无统计学差异。提出“一致性而无对齐”概念,指出依赖项目敏感性或自一致性的评估若缺乏独立参考,可能产生误导,揭示项目敏感性不等于任务能力

📄 Few-Shot Out of Domain Intent Detection:协方差校正的 Mahalanobis 距离

针对少样本设置下 OOD 意图检测性能不足的问题,提出协方差校正的 Mahalanobis 距离方法。该方法改进了原有算法,在少样本场景下有效识别未知意图,优于现有基线。

📄 Beyond the Clock:衡量自适应修订的价值

研究层级潜在推理器中的元级控制问题,发现学到的修订时机并未优于强固定调度策略。研究分离了状态依赖与决策价值,指出在决策预算限制下,强固定调度已捕获大部分可测量的价值。

📄 Towards a Reliable and Practical Eval Pipeline:可靠的评估流水线

提出端到端评估流水线,结合评估清单创建与学习聚合,提高 LLM 法官间的一致性及与人类判断的准确度。该框架还提供自洽性、解释与预测不确定性,实证显示其有效性。


🚀 产品发布

💹 福特 Fathom 电动卡车起售价 3 万美元,目标首年销量 10 万辆

福特推出新款电动卡车Fathom,起售价约3 万美元,将于明年上市。该车基于全新自研平台打造,旨在对标特斯拉及中国车企。公司设定了雄心勃勃的目标:投产首年实现超10 万辆销量,这是此前仅有特斯拉在美国市场达成的单一电动车型销量纪录。

比亚迪海狮 08 正式上市,售价 22.99 万元起

比亚迪旗下海洋网旗舰六座 SUV****海狮 08正式上市,提供插混与纯电双版本。插混版售价22.99-26.99 万元,纯电版售价23.99-27.99 万元。新车搭载云辇-A智能车身控制系统与双腔空气悬架,轴距达3030mm,并配备21.4 英寸后排吸顶屏,主打高端家用市场。

▶️ Acer Swift Blade 14 发布:比 MacBook Air 轻近一磅

Acer推出新款轻薄本Swift Blade 14,采用碳纤维材质,重量仅799 克(约 1.76 磅),厚度12.95 毫米,比同尺寸MacBook Air轻约0.9 磅。内置 Intel Wildcat Lake 处理器,旨在挑战苹果在极致便携与高性能平衡领域的市场地位。

Starman Holding 以 2.85 亿美元收购 GoPro

Starman Holding宣布以2.85 亿美元现金收购运动相机制造商GoPro几乎所有股份。原股东将保留公司**10%**的股份,包括 YouTube 主播 Markiplier 持有的部分股权,标志着这家老牌运动相机厂商易主。

腾讯 WorkBuddy 开放平台上线,接入 30+ 行业应用

腾讯旗下 AI 智能体WorkBuddy开放平台正式上线,首批引入超百家生态伙伴,面向智能硬件、金融、医疗等20 多个领域开放底层 Agent 能力。旨在打造面向智能体时代的操作系统,承载各类工具。

理想汽车发布新一代 MEGA,全系标配前两排零重力座椅

理想汽车正式发布新一代MEGA,统一零售价为50.98 万元,较旧款降价5 万元。新车保留水滴形设计,前排双座升级为零重力座椅,第三排增加通风功能。此外,计划于 2026 年底推出右舵版,进军港澳、新加坡等市场。

▶️ Range Rover 发布纯电车型,外观延续经典设计语言

路虎推出全新Range Rover Electric,搭载双永磁电机和118.5 kWh双层锂电池,续航里程约330 英里。该车未采用激进的未来主义设计,而是保持了与燃油版高度一致的外观,旨在平衡电动化转型与品牌经典形象。

🏠 华为官宣刘德华担任 Mate XT 2 非凡大师品牌大使

华为官方宣布刘德华继续担任HUAWEI Mate XT 2 非凡大师品牌大使。新机将于9 月 7 日举行发布会,搭载HarmonyOS 7系统。此前刘德华已为该系列演唱主题曲,此次合作旨在强化超高端品牌形象。

🔶 丰田推迟美国产电动汉兰达 SUV 上市时间至 2027 年

丰田宣布将美国生产的电动版汉兰达 SUV上市时间从原定的 2026 年下半年推迟至2027 年或更晚。这一调整反映了大型车企在电动化转型过程中面临的产能规划与市场节奏挑战,同时也显示出对现有燃油车市场的持续依赖。

初创公司 Fambot 获 350 万美元融资,推出家庭 AI“参谋长”

Fambot正式发布面向家庭的 AI 产品,旨在帮助家长管理儿童活动和学校通知等繁杂事务。该公司近日获得350 万美元融资,专注于解决家庭后勤自动化难题。

▶️ Tado Smart Thermostat X 二代上市,对标 Google Nest

德国智能家居品牌Tado发布第二代Smart Thermostat X,支持 Matter-over-Thread 协议。该产品旨在承接因Google退出欧洲市场而流失的Nest用户,提供智能温控解决方案,填补市场空白。

💻 Adobe 集成 Express、Premiere 等工具至 Slack

Adobe宣布将其ExpressPremiereAcrobat等工具直接集成到Slack平台,允许用户在聊天界面中直接访问和使用这些创意生产力工具,提升团队协作效率。

传祺越 7 SUV 开启预售,权益价 17.18 万 -21.78 万

广汽传祺全场景智享硬核 SUV传祺越 7**正式开启预售,预售价区间为17.18 万元至 21.78 万元。新车定位为大型 SUV,主打智能化配置与家庭出行场景,预计近期正式上市交付。


🌍 国际大事

习近平访问埃及提出中东安全新架构四点倡议

中国国家主席习近平结束对埃及国事访问,埃及总统塞西举行会谈并提出构建中东安全新架构四点倡议。双方就双边关系及地区热点问题进行深入交流,签署共建“一带一路”、人工智能等20 余份合作文件。此时正值美伊军事冲突升级之际,中方强调由地区人民主导安全事务,巴勒斯坦问题仍是核心,并重申愿维护国际航道安全。

美伊军事冲突急剧升级致多名美军死亡

伊朗伊斯兰革命卫队宣布对美军在科威特的基地实施导弹和无人机联合打击,造成多名美方人员死亡**。随后美军中央司令部发表声明,已完成对伊朗防空阵地、雷达系统及布雷能力的新一轮打击,中东地缘风险显著抬升。联合国秘书长古特雷斯发表声明,呼吁双方立即停止军事行动,遵守国际人道法,并尽快重返外交谈判轨道。

沙特石油出口暴跌至 9 年最低

受中东局势影响,沙特阿拉伯8 月可观测原油出口量骤降至约300 万桶/日,为 2017 年以来最低。受霍尔木兹海峡至红海油轮遇袭风险加剧影响,全球供应链受阻,迫使利雅得寻找绕道非洲航线。此外,特朗普政府沙特阿拉伯达成的民用核协议细节显示,沙特可能在境内进行最高**20%**浓度的铀浓缩,引发外界对核扩散的担忧。

联合国报告警告全球气温升幅数年内将超过 1.5 度

联合国环境规划署 (UNEP) 发布重磅报告警告,若维持当前气候对策,全球平均气温将在10 年内超过工业革命前1.5 度,到 2100 年可能上升2.6 度甚至更高。报告强调需将超温持续时间缩至最短以减轻灾害风险。叠加厄尔尼诺现象概率近100%的预测,全球农产品面临复合冲击,咖啡可可等价格显著上涨,极端天气灾害风险升至危机水平。

中国否决 G20 全球经济联合声明

由于中国单独抵制批评其出口战略的语言,来自 20 国集团的高级经济官员无法就联合声明达成一致。美国财长贝森特明确表示,拥有世界上最大不可持续经常账户盈余的国家——中华人民共和国——是那个反对者。会议最终在美国财政部发布主席声明的情况下结束。

俄德莱比锡机场袭击事件引发外交制裁升级

俄罗斯驻德国大使馆声明称,针对莱比锡机场的袭击未遂事件指控“毫无根据”,指责德国制造“挑衅”。此前德国认定俄方负责并宣布制裁,俄大使称此举标志俄德关系“前所未有的恶化”。随后俄罗斯外交部就德国关闭驻波恩总领事馆一事,召见德国驻俄临时代办**,进一步加剧了双边紧张局势。

荷兰央行将黄金储备从美加转至伦敦

荷兰央行已将价值约120 亿美元**的黄金储备从纽约和渥太华转移至伦敦,占其原先存放在美国和加拿大黄金储备的四分之一以上。此举旨在提高黄金储备的可交易性,以应对全球地缘政治动荡加剧的风险。

白宫:委内瑞拉协议原油最早 11 月进入美国战略储备

白宫表示,根据与委内瑞拉签署的协议,相关原油最早可能于11 月进入美国战略储备。此举旨在缓解能源供应紧张,但分析师指出委内瑞拉原油开采难度大,难以完全替代霍尔木兹海峡受阻的石油供应。委内瑞拉代总统罗德里格斯会见美国能源部长赖特**,两国正式签署多项合作协议,雪佛龙等美企将获得委内瑞拉已探明石油储量中逾650 亿桶的“多数控制权”。

中国地震局连发三文严正警告违规预警行为

中国地震局**连续发布三篇文章,强调地震预警信息必须统一发布**。针对成都高新减灾研究所擅自利用自建系统生成“四川长宁 7.7 级”预警并违规推送的行为,官方定性为严重违规,并已终止与其播发协议。国家地震预警工程累计发布预警700余次。

特朗普会见航空及酒店业高管

特朗普今日与美国各家航空公司首席执行官会面,并会见了希尔顿万豪米高梅的高管,讨论行业相关议题。同时,特朗普总统签署了临时拨款法案使其正式生效,暂时避免了美国政府停摆风险。一名美国联邦法官还发布禁令,阻止特朗普政府**执行最新限制“出生公民权”的行政令。

💹 美国南方司令部击沉贩毒船只

美国南方司令部**联合厄瓜多尔政府,在西半球联合特遣部队(JTF-WHEM)行动中成功拦截并击沉一艘充当海上移动加油站的船只**。该船只为暴力贩毒组织“洛斯乔内罗斯”提供支持,此次行动切断了贩毒物流链的关键节点,展示了美洲反卡特尔联盟的执法力度。

美国国务卿鲁比奥重申对伊朗航运攻击行动

美国国务卿鲁比奥表示,美国将继续针对伊朗的航运攻击采取行动,并将制裁帮助伊朗获取收入的国家。此举加剧了中东地区的紧张局势,与伊朗伊斯兰革命卫队宣布对美军在科威特的基地实施导弹和无人机联合打击形成对峙,造成多名美方人员死亡**,伊朗外交部强烈谴责美国袭击民用设施造成70 多名伊朗人死伤

俄罗斯国防部一天内击落 238 架乌克兰无人机

俄罗斯国防部通报,俄防空部队在一天内成功击落238 架**乌克兰无人机。这一数据反映了俄乌冲突中空中对抗的激烈程度,也显示出俄方防空系统的拦截效率。此外,俄罗斯国防部还宣布对位于敖德萨地区达赫诺耶附近的奥德萨 -22 配送中心进行了打击

英国前财长分析美国债券市场动荡深层逻辑

英国前财长吉姆·奥尼尔分析认为,美国债券市场的脆弱性可能源于市场对通胀数据的误判、美联储主席沃什的新理念,以及超大规模 AI 企业对债券发行的竞争。他指出,若财政赤字无法持续,美元地位可能受到长期挑战。美伊冲突升级也引发全球债市抛售潮,美国日本等国债券市场遭遇剧烈波动。

尼泊尔泥石流灾害遇难人数升至 1204 人

尼泊尔国家减少灾害风险管理局公布,截至当地时间 9 月 2 日 18 时,该国北部地区泥石流灾害造成的死亡人数升至1204 人,另有4216 人失联。这是该国近年来最严重的自然灾害之一,救援工作仍在紧张进行中。

以色列启动反向输水工程注入加利利湖

以色列耗资数十亿谢克尔启动反向输水项目,将淡化海水注入加利利湖以恢复水位。该项目旨在平衡淡水资源,避免湖泊干涸。尽管初期投入巨大,但通过平滑需求曲线,长期来看具有显著的经济效益。

阿根廷外长重申必须掌握一切手段实现对马岛主权

阿根廷外交部长**巴勃罗·基尔诺表示,阿根廷必须掌握一切可用手段,最大限度捍卫国家利益,实现全体阿根廷人的共同目标,即实现对马尔维纳斯群岛的主权。美国总统特朗普此前暗示或将重新考虑美国政府在争端中的立场。

柬埔寨制定消除地雷十年路线图

柬埔寨**启动《2026—2035 年国家地雷行动政策》,制定了消除全国范围内所有已发现的地雷、集束炸弹和其他战争遗留爆炸物的十年路线图**。目标是到2030 年清除所有已发现的地雷,到2035 年清除所有其他战争遗留爆炸物。


📈 财经市场

博通 Q3 财报超预期,净利润同比暴增 216%

**博通 (AVGO.O)**公布 2026 财年 Q3 财报,营收295.9 亿美元,净利润131 亿美元,同比增长216%。其中AI 半导体收入达167 亿美元,同比增长221%。公司预计 Q4 营收约为348 亿美元,并确认未来两年将向客户交付约3500 亿美元的 AI 芯片,2027 年和 2028 年 AI 芯片收入分别达1150 亿2300 亿美元

Snowflake 上调全年指引,盘后股价大涨超 20%

**Snowflake (SNOW.N)**发布季度业绩,营收同比增长35%15.5 亿美元,超出市场预期。公司上调全年产品收入指引至60.7 亿美元,非 GAAP 经营利润率预期提升至14.5%。其 AI 辅助编码工具CoCo新增2000 个账户,推动盘后股价上涨超20%

月之暗面 (Kimi) 秘密递交港交所 A1 文件,启动 IPO 流程

月之暗面 (Kimi) 已于本周以保密形式向港交所递交 A1 文件,正式启动港股 IPO 流程。据悉,Kimi 正在推进投前估值约500 亿美元的新一轮融资,此前 K3 发布后企业 ARR 出现数倍增长,这很可能是上市前的最后一轮融资。

美银警告美股买盘枯竭:9 月仅余 90 亿买盘空间,下跌或触发 1630 亿卖盘

美国银行测算显示,当前系统性策略在市场上涨情景下仅剩约90 亿美元买盘空间;一旦市场下跌,来自 CTA 和波动率控制策略的抛售规模可能高达1630 亿美元**。这种极度不对称的买卖结构叠加企业回购静默期扩大,令 9 月市场风险骤然上升。

蔚来二季度交付超 10 万辆,毛利率提升至 18.5%

蔚来汽车发布 2026 年 Q2 财报,季度交付量达10.7 万辆,同比增长近五成;汽车销售额增至290.5 亿元,同比上涨80.1%。汽车业务毛利率同比提升8.2 个百分点18.5%,高端车型ES8ES9表现强劲,拉动整体盈利水平显著改善。

SK 海力士拟深化与铠侠合作,日本建厂或重塑 NAND 竞争格局

SK 集团会长崔泰源透露,SK 海力士正考虑在日本建设芯片工厂并与铠侠深化合作,双方若联合生产NAND 闪存**,市场份额合计将超三星电子。目前SK 海力士持有铠侠14.19%股份,若合并计算两者份额将达到36%,显著高于三星的25%

🔶 微软宣布重组财务报告架构,Azure 将单独披露营收

微软提交 SEC 文件,宣布自 2027 财年起将业务部门缩减为两大块:Agents and InfraDevices and Consumer**。作为调整一部分,公司将首次按季度单独披露Azure云业务的营收数据,旨在回应华尔街长期对缺乏 Azure 透明度的批评。

全球债市风暴持续:10 年期美债收益率突破 4.8%,日本国债触及 3%

受油价飙升及地缘政治影响,10 年期美债收益率突破**4.80%**创近三年新高30 年期收益率突破5.27%日本 10 年期国债收益率时隔 30 年首次触及3%,德国 10 年期收益率升至 15 年来高位。彭博全球政府债券指数收益率升至3.72%,创 2008 年以来最高水平,预示全球金融条件将剧烈收紧。

𝕏 Broadcom 预期 AI 芯片收入将在 2027-2028 年翻倍

Broadcom财报显示,AI 半导体营收达167 亿美元(同比增221%,占总营收56%。公司预计 2027 年 AI 芯片收入将达1150 亿美元**,2028 年达2300 亿美元,呈现爆发式增长,验证了 AI 基础设施建设的强劲需求。

伯克希尔确认投资 Alphabet 100 亿美元,巴菲特看好 AI 数据中心能源机遇

伯克希尔哈撒韦CEO 格雷格·阿贝尔证实,公司 15 个月前以6.5%折扣投资谷歌母公司Alphabet,规模达100 亿美元**。阿贝尔表示,人工智能数据中心是伯克希尔能源业务的重要机会,愿意承接超大规模企业的能源需求,并认为谷歌在 AI 领域地位强劲。

💻 Uber 收购 Delivery Hero 获董事会支持,交易估值 150 亿美元

Delivery Hero董事会已批准Uber提出的150 亿美元**收购要约。若交易获批,两家巨头合并后将形成全球最大的食品配送平台之一。此举标志着全球外卖行业格局的重大整合。

🏠 优步全球裁员 10%,3300 岗位受波及以聚焦 Robotaxi 业务

优步 (Uber) 宣布裁减约3300 个岗位,相当于全球员工总数的10%。公司将把节省的资金重新投入网约车、配送和Robotaxi业务,计划未来几年向 Robotaxi 合作项目投入超过100 亿美元,此次重组旨在减少管理层级,管理人员数量预计减少20%

财政部等三部门规范限售股减持个税政策

财政部、税务总局、证监会联合发布新规,自 2026 年 8 月 28 日起,将解禁后的送转股纳入限售股转让个税征税范围,堵住通过“高送转”避税漏洞,并取消按转让收入**15%**核定原值的做法,促使纳税人合规申报真实成本纳税。

杭州银行半年报:营收净利双增,分红再提两成

杭州银行披露半年报,上半年营收210.48亿元(+4.75%),净利润128.13亿元(+9.87%)。不良贷款率维持0.76%,拟每 10 股派现4.60元,同比增长21.05%。净息差逆势升至1.39%,利息净收入增长近两成,经营稳健。

摩根大通警告美债收益率若破 5%,美股或迎健康回调

摩根大通私人银行主管 Grace Peters 警告,10 年期美债收益率逼近5%,美股可能面临5% 至 8%**的回调压力。尽管短期风险升温,该行仍看好全年表现,认为当前盈利增长基础较过去更广泛,且 AI 基础设施扩张将利好公用事业板块。

🔶 伯克希尔·哈撒韦承诺长期支持日本五大商社

伯克希尔·哈撒韦CEO格雷格·阿贝尔承诺长期支持三菱商事**、三井物产日本五大商社。该公司已将每家持股比例提高至**10%**以上,预计这些商社的核心盈利将继续增长,股息和股票回购也可能增加。

焦炭期权在大商所上市,黑色产业链避险工具闭环

焦炭期权正式在大连商品交易所上市,标志着国内煤焦钢产业链衍生品工具体系完善。当日主力合约报2181.5 元/吨,成交量9.2 万手,为钢铁与煤化工产业提供了关键的风险管理工具,补齐了产业链短板。

现货黄金价格走出 V 形反弹,逼近 4400 美元

现货黄金价格经历大幅波动后走出 V 形反转,盘中最低触及4282.63 美元后回升,美盘时段上涨1.38%,重新逼近4400 美元关口。美元指数下跌 0.11%至 99.51。同期现货白银上涨1.92%65.14 美元,录得 8 月 21 日以来最大跌幅。

外资二季度加仓 A 股:持仓市值超 3 万亿,宁德时代居首

截至 6 月 30 日,外资持有 A 股市值超3万亿元,较 3 月底增长4.75%宁德时代以超3600亿元市值位居第一重仓股。二季度外资增持电子、电力设备等行业,减持生物医药、银行等板块,其中电子行业持股增加19.46亿股。

现货黄金盘中失守 4300 美元,金饰克价一周跌百元

现货黄金周三盘中一度跌破4300 美元/盎司,为 8 月以来首次。受美债收益率走高及油价飙升影响,金价承压。国内品牌金饰价格同步下调,老庙黄金足金饰品单日大跌37 元,周生生大跌36 元

以色列 2025 年外国直接投资增长 78%创纪录

以色列财政部数据显示2025 年外国直接投资增长78%,创下262 亿美元的新纪录;2026 年第一季度持续上升趋势,显示出该国经济吸引外资能力的显著增强。

💻 HiddenLayer 融资 1 亿美元,企业 AI 安全需求激增

HiddenLayer宣布完成1 亿美元**融资,专注于监控 AI 智能体及其使用的工具和插件。随着企业加速部署 AI 应用,对 AI 安全产品的需求急剧上升,该公司旨在填补 Agent 安全监控的市场空白。

券商自营业务爆发:上半年赚 1600 多亿,中信证券领跑

上半年37家可比券商合计实现自营收入1660.78亿元,同比增长超五成。中信证券自营收入达269.27亿元,占营收比重约54%。券商重仓股以大金融为主,中信建投持仓市值超百亿,同时减仓部分中字头龙头股。

A 股两成上市公司半年业绩增收不增利

A 股共5554 家上市公司披露半年报,营收增长公司占比63.4%,但归母净利润正增长仅占46.2%1096 家公司处于营收增长但净利润下滑状态,汽车零部件行业受成本挤压最严重,反映出行业盈利压力依然较大。

美股反弹:标普 500 止住三连跌,油价回落缓解通胀担忧

标普 500 指数止住三连跌美国原油价格回落至每桶90 美元下方,缓解了市场对通胀的担忧。交易员继续评估美联储未来可能的加息路径,市场情绪有所回暖。

💻 Wonderful 估值翻倍至 50 亿美元,Series C 融资 5.5 亿美元

Wonderful完成5.5 亿美元**C 轮融资,公司估值达到50 亿美元,半年内估值翻倍。资金将用于加速产品开发及扩展 FDE(全栈开发工程师)团队,以满足市场对 AI 生成软件的需求。

钼行业高景气周期:洛阳钼业净利增 86%,供需缺口扩大

洛阳钼业上半年归母净利润161.52**亿元,同比增86.27%。受供需紧张影响,钼精矿价格累计涨幅近40%。预计 2026 年全球钼总产量27.27万吨,消费量超30万吨,全年供需缺口达4.43万吨,创近年峰值。

🔶 美股三大指数集体收涨,英伟达涨超 3%

9 月 2 日收盘,美股三大指数集体上涨,纳指0.45%标普 5000.46%道指0.56%英伟达涨超3%,Meta 涨超2%;热门中概股普跌,蔚来跌近5%

芒果超媒 AI 长剧《后西游记》热播,股价连续涨停

芒果超媒首部上星 AI 长剧《后西游记》首播收视率位居省级卫视第一,制作成本较同类剧集显著降低。受此利好影响,公司股票于 8 月 31 日、9 月 1 日连续两日20CM 涨停,市值达到384 亿元

🔶 美联储褐皮书显示经济活动缓增,数据中心需求强劲

美联储**发布的褐皮书指出,美国经济活动在过去两个月呈现缓增态势,主要受数据中心需求推动。尽管能源价格和地缘政治带来不确定性,但整体就业略有增加,制造业活动因国防和数据中心订单而增长,高端消费支出稳健。

瑞士嘉盛银行续看好金价及大宗商品

瑞士嘉盛银行维持股票“轻微增持”评级,债券“轻微减持”评级。该行认为黄金及大宗商品持仓将受惠于海湾地区局势及美国财政部扩大回购国债政策,同时指出 AI 概念主导的股市升势放缓,投资者转趋审慎。

英伟达市值突破 5.46 万亿美元,涨幅扩大至 4.4%

英伟达股价上涨,总市值报5.46 万亿美元。市场对其 AI 芯片需求的持续看好推动股价攀升,成为科技股中的领头羊,盘后股价表现强劲。

挪威水力发电储量跌至历史新低,加剧欧洲电价上涨风险

挪威最南端 NO₂价格区水力发电储量仅为15.6 太瓦时**,低于 1996 年创下的同期最低水平。作为欧洲最大电力出口国,水位下降削弱了缓冲作用,奥斯陆 Volt Power Analytics 总经理警告今冬欧洲电价存在大幅上涨风险,影响将持续至春季。

𝕏 Minimax H3 Max 价格下调,直播流盈利门槛分析

Minimax下调H3 Max**视频模型价格,按全时运行计算月成本约3.29 万美元。创作者分析若月营收超此数值即可实现 AI 直播流盈利,目前已有创作者达到1.5 万美元月收入,AI 商业化落地速度加快。

公募基金定增浮盈分化:江波龙等项目成“陷阱”

今年公募参与定增合计获配金额451.44亿元,浮盈37.55亿元。但部分热门项目如江波龙因定价倒挂股价腰斩,导致投资者浮亏。易方达、财通基金等机构在电子行业定增布局积极,但收益出现明显分化。

🔶 美国 8 月 ADP 就业人数增加 3.8 万人,低于预期

ADP数据显示,美国8 月份就业人口增加3.8 万人,远低于市场预期的4.7 万人**,也低于前值的4.4 万人。这一数据表明美国劳动力市场降温迹象明显。

🔶 标普全球考虑分拆数据和研究平台 CapIQ

据报道,标普全球正在考虑分拆其旗舰数据和研究平台Capital IQ Pro (CapIQ),可能创建一家估值数十亿美元的独立公司。目前相关讨论仍处于初步阶段,最终决定尚未做出。

上海二手房 8 月成交 2.07 万套,同比增 18%

上海市房管局数据显示,8 月份上海二手住房成交2.07 万套,同比增加18%。尽管当月雨量创下历史同期第二高,台风频频叨扰,市场仍释放出复苏信号,“金九银十”旺季有望加速兑现。

🔶 安集科技向港交所递交 H 股上市申请资料

安集科技**公告,已于9 月 2 日通过保密形式向香港联交所递交了发行H 股股票并在港交所上市的申请资料,并将按照相关法律法规履行中国证监会备案手续。

荷兰央行转移黄金储备:从美加移至伦敦

荷兰央行宣布将部分黄金储备从美国和加拿大转移至伦敦**,理由是地缘政治不稳定。此举被视为全球央行多元化储备策略的一部分,反映了国际局势变化对资产安全配置的深远影响。


🏭 工业能源

全球首款完全由 AI 设计的芯片 Redwood 问世,能效提升 3.4 倍

Architect Labs宣布其 AI 系统自主设计了量产型加速器Redwood**,仅用不到两周时间完成设计与验证。基于三星 8nm 工艺,Redwood 吞吐量是 NVIDIA Jetson Orin Nano 的 1.75 倍,功耗降低 1.9 倍,每瓦性能提升 3.4 倍,标志着芯片设计范式的转变。

𝕏 美国 KYC 系统遭黑客攻击,1.53 亿驾照信息泄露

美国身份验证系统发生严重数据泄露,1.53 亿份驾照信息被窃,占全美驾照总数的 63%。由于驾照在美国作为政府签发照片 ID 的核心用途,此次事件引发对身份安全的广泛担忧,暴露出关键基础设施的安全隐患。

韩国万亿级主权 AI 投资:英伟达胜出,本土存储厂商承压

韩国政府**宣布投资 9190 亿美元建设 AI 算力基础设施,目标 2029 年建成 8.4 吉瓦数据中心。虽然计划利好整体产业,但三星SK 海力士面临挑战,因缺乏本土 AI 加速器供应商,且英伟达已与 SK 海力士锁定 HBM 优惠定价,本土企业利润空间受限。

💹 国家级零碳工厂建设全面启动,工信部部署“十五五”目标

工业和信息化部启动国家级零碳工厂**建设工作,首批申报截止时间为 2026 年 8 月 15 日。“十五五”期间,我国计划培育建设500 家零碳工厂。福建、河北等地已率先出台管理办法或公布省级名单,推动制造业绿色转型从探索阶段进入实战建设阶段。

🔶 奇瑞集团累计出口突破 700 万辆,成为首家达成此成就的中国车企

奇瑞集团8 月销售28.01 万台,其中出口 19.7 万辆,同比增长 52.1%。至此,奇瑞成为首个累计出口突破700 万辆的中国汽车企业,展现了强大的海外市场竞争力。同期,吉利汽车 8 月出口 11 万辆,同比大增 205%,中国车企出海势头强劲。

💻 谷歌斥资购买增强型地热能源,助力 AI 数据中心供电

Google 与 Fervo 签署协议,购买 400 兆瓦的增强型地热电力,未来可能扩展至 1 吉瓦。这笔交易足以为一个大型 AI 数据中心供电,标志着清洁能源在支撑高能耗 AI 基础设施方面的关键进展。

韩国 SaaS 公司股价反弹,Salesforce 单日暴涨 23% 创六年新高

经历

商务部等三部门发文引导车企规范海外竞争

商务部、工信部、市场监管总局联合发布《汽车行业境外竞争行为与合规建设指引》,要求车企在海外进行价格合规管理,避免多频次、大幅度价格波动扰乱市场秩序。文件明确企业需做好零部件、整车等产品价格合规,不为获得不正当竞争优势而扰乱市场,旨在引导新能源汽车出海健康有序发展。

AI 扩产潮揭示铒钇供应链卡脖子,中国占这两种小金属 100% 产量

IEEE 报道指出,两种小金属分别用于光通信网络和燃气轮机高温材料,是 AI 数据中心网络与电力的关键。据称我国占了这两种小金属几乎**100%**的产量,随着 AI 资本开支向光网络和电力系统扩散,中国供应链优势进一步凸显。

🏠 比亚迪 8 月销量超 44 万辆稳居榜首,智界增幅最大

2026 年 8 月汽车销量榜出炉,比亚迪凭借 440,293 辆的成绩继续领跑上汽集团以 357,007 辆位居第二。智界汽车同比增幅最大,达 404.2%。零跑汽车连续卫冕新势力销冠,销量维持在 10 万辆以上水平。

🏠 燧原科技科创板 IPO 中签率公布,募资用于第五代 AI 芯片研发

**燧原科技**公告称,科创板 IPO 网上发行最终中签率为 0.02455315%。本次发行股份数量为 4303.5173 万股,发行价 142.18 元/股。募集资金将主要用于第五代和第六代 AI 芯片系列产品的研发及产业化项目。

🏠 谷歌拆解退役服务器回收 DDR4 内存应对 AI 算力瓶颈

面对 AI 产业从“算力受限”转向“内存受限”,服务器中高性能内存成本占比已高达75%谷歌回收DDR4 内存用于 AI 服务器,试图通过循环利用缓解高昂的内存采购成本,提升算力基础设施的经济性。

荷兰央行转移 120 亿美元黄金储备至伦敦,应对地缘风险

荷兰央行**将约 86 吨黄金(价值 120 亿美元)从纽约和渥太华转移至伦敦。此举旨在利用伦敦市场的流动性优势,在地缘政治动荡背景下增强储备资产的韧性和危机时的快速动用能力。

📄 Space Generative AI with Solar Energy Harvesting:太空生成式 AI 能源优化框架

该研究提出卫星太阳能供电的生成式 AI 框架,解决能量受限下的计算 - 通信权衡。通过轨道动力学预测,开发了联合资源优化策略,在真实轨道模拟中显著提升了端到端生成性能,平衡了图像质量与下行传输可靠性。

🔶 Equinix 携手英伟达、Together AI 推出人工智能推理交换平台

Equinix发布分布式人工智能推理框架Equinix Inference Exchange整合英伟达企业参考架构、Together AI开源模型平台及Equinix全球数据中心基础设施。该平台将于 2027 年第一季度正式上线,支持 200 余款开源模型。

中际旭创大股东章建平消失,公司拟回购 40 亿至 80 亿元

光模块龙头中际旭创公告显示,截至 8 月 31 日,前十大股东名单中已无章建平身影。同日,公司披露拟投入 40 亿元至 80 亿元回购公司股份,回购价格上限 1200 元/股,用于股权激励及员工持股计划。截至 9 月 2 日收盘,股价跌破 1 万亿元市值大关。

🔵 ASML 供应商称中国在顶级芯片制造工具方面落后 15 年

蔡司集团**(Zeiss Group)CEO Frank Rohmund 表示,中国在开发尖端芯片制造工具方面落后约15 年。作为 ASML EUV 光刻机的关键供应商,蔡司认为北京需要 15 年才能开发出 EUV 光刻机,而额外的出口管制只会加速中国的创新进程。

🏠 欧盟法院驳回 Opera 诉讼,维持微软 Edge 不受 DMA“看门人”监管

欧盟普通法院裁定支持欧盟委员会的决定,不将微软 Edge浏览器认定为《数字市场法》(DMA)下的“守门人”。法官认为 Edge 并不构成一个重要的用户访问门户,Opera 挑战失败,Edge 将继续保持现有监管状态。

宏达电子陶瓷产品成为头部光模块厂商合格供应商

宏达电子公告,其单层陶瓷芯片电容等产品成为多家头部光模块厂商合格供应商。上半年民用陶瓷薄膜电路、单层陶瓷电容实现营业收入 1.51 亿元,同比增长 240.79%,业绩爆发式增长。

📄 FractalNet-Based Heterogeneous Federated Learning:卫星星座联邦学习新架构

针对卫星巨型星座的 SWAP-C 限制,提出基于FractalNet的异构联邦学习方法。通过分布式路径调度器分配模型深度,并在野火检测案例中展示了不同轨道层级学习不同语义水平的能力,验证了收敛性与能效优势。

🔶 软银空中基站 HAPS 通信试验取得成功

软银在日本上空成功开展空中手机基站 HAPS的通信试验。基站为飞艇型,可在距地面约 20 公里的空中持续飞行数月至半年。此次试验确认了包括紧急呼叫在内的语音通话功能,计划 2027 年扩大飞行区域。

大众汽车激进重组计划曝光,4 家德国工厂面临关闭

大众汽车**集团 CEO 奥博穆内部备忘录显示,公司正推进激进重组计划,埃姆登、汉诺威、茨维考和内卡苏尔姆等 4 家德国工厂运营方案存疑,可能在本世纪 30 年代面临关闭风险,涉及数万名员工的岗位调整。

节卡机器人遭泰瑞达起诉:欧洲专利诉讼频发

全球协作机器人巨头泰瑞达旗下优傲机器人向欧洲统一专利法院提起诉讼,指控节卡机器人德国子公司侵犯多项硬件与软件专利。这标志着中国智造出海面临更严峻的知识产权挑战,欧洲统一专利法院降低了对手起诉成本。

碧澄能源 CEO:电改将在用户侧释放更大潜力

碧澄能源CEO 李文轩指出,电力市场化改革深化后,中小企业灵活用电、虚拟电厂等用户侧业务空间有望打开。未来十年新能源装机倍增,发电侧和需求侧错配问题将加剧,用户侧将成为电改的关键发力点。

🔶 英国风力推进创企 Anemoi 将为马士基集装箱船提供旋翼帆

英国风力推进技术创企Anemoi Marine Technologies将为马士基利马号集装箱船提供直径 5 米、高 35 米的固定式旋翼帆系统。该系统预计于 2027 年中期安装,旨在降低燃油消耗和碳排放,助力航运业脱碳。

📄 RestoreBench:AI 智能体恢复电力流收敛能力的基准

RestoreBench评估 LLM 智能体诊断和解决电力流不收敛问题的能力,覆盖 2 个电网和 46 个案例。该基准定义了仿真环境与评价指标,为开发用于电力系统规划与操作的自主 AI 系统提供了可复现的基础。

机器人表演伤人事件频发:行业缺乏规范与安全兜底

湖北襄阳科技馆发生机器人伤人事件,引发对公共场合人机共场安全的关注。目前机器人租赁市场门槛低,缺乏操作资质要求和落地规范。行业专家呼吁建立指引规范和完善事故溯源机制,明确责任主体。

🏠 星宇股份回应劝退应届生:深刻反省并真诚道歉

常州星宇车灯股份有限公司就“羞辱式劝退应届生”事件致歉,承认沟通生硬、方法简单。公司已对人力资源总监停职处理,承诺以制度和流程保障劳动者权益。此前 107 名应届生被解除劳动合同,人社部门已介入提供就业服务。

🔶 广东鸿图拟投资 2.74 亿元设立全资子公司开展镁合金压铸业务

广东鸿图公告,拟在肇庆市高要区投资新设全资子公司,开展镁合金压铸业务。项目总投资 2.74 亿元,将通过新设子公司作为实施主体,投资建设相关产能,进一步拓展轻量化材料应用领域。


🧠 深度思考

美国财政部演变为“影子央行”,侵蚀美联储货币政策独立性

深度分析指出,随着国库券发行规模扩大,美国财政部正通过短期债务融资介入货币发行领域,削弱美联储的政策独立性。这种结构性变化可能导致通胀压力上升,并使利率政策受制于财政成本,形成难以调和的矛盾,对美国宏观经济稳定构成潜在威胁。

💹 华尔街资金大迁徙:高价抢筹 AI 债推高美债收益率

科技巨头大规模涌入投资级债券市场,以高于国债的利差吸纳资金,导致长债抛售潮。分析认为,当前长端利率走势受财政扩张AI 投资热潮及全球油价多重变量驱动,一旦突破阈值可能触发避险连锁反应。华尔街正上演“卖美债,买 AI 债”的资金大迁徙,成为推高美债收益率的重要推手。

SaaS 行业复苏:AI 替代威胁被高估,专业护城河决定生死

经历

💹 AI 办公智能体走进企业一线:从对话工具变身干活主力

AI 办公智能体正在进入企业一线业务场景,从“对话工具”转变为“干活员工”。在晶科能源,财务人员月度预算分析用时从2 天缩短至15 分钟;蒙牛一线员工自主开发出45 个AI 数字员工。国内主流 AI 办公智能体月访问量从 3 月的2000 万次跃升至 6 月的6000 万次,市场需求旺盛推动科技公司密集入局。

智能时代制式化教育危机:知识供给滞后与人才脱节

文章指出,工业文明时代的制式化教育体系与智能时代的知识迭代节奏存在根本冲突。教材更新滞后、统一授课局限信息获取、单一标准禁锢多元解读,导致人才培养与经济脱节。教育需回归育人本质,培育适配智能社会的独特人才,打破标准化生产的桎梏,以适应快速变化的技术环境。

主权 AI 竞赛悖论:政府追求独立却依赖英伟达

剖析了韩国万亿美元 AI 投资背后的矛盾:政府试图建立自主 AI 生态,但因缺乏本土加速器供应商,最终仍依赖英伟达硬件。这种“主权 AI

取消外籍个税免征:中国税制走向公平与营商环境升级

财政部、国税总局发布公告,自9 月 1 日起取消外籍个人从外商投资企业取得股息、红利所得免征个人所得税优惠政策。社论认为,这标志着中国对外资吸引力从依赖税收优惠转向依靠宜人宜商的营商环境,是中国制度自信的重要体现。此举有助于营造更加公平的竞争环境,吸引高质量外资。

医保打包付费 3.0 版落地:产科新生儿科有望扭亏

国家医保局发布按病组(DRG)和病种分值(DIP)付费3.0 版分组方案,将于2027 年 3 月底前落地。新方案针对超早产儿(出生体重低于1000 克)等特例病例实行单独分组,次均费用随体重降低相应抬升,并设置无痛分娩独立支付分组,旨在解决医疗机构政策性亏损问题,保障母婴健康权益。

𝕏 生产环境三大隐形杀手:距离、冷启动与流量费

资深开发者指出,本地测试完美的 AI 功能上线后常因网络延迟(跨洲100ms+)、服务器冷启动(秒级延迟)及高昂的出口流量费(如 AWS 曾豁免25 万美元)而失效。这些隐性成本是原型开发中常被忽视的关键,提醒开发者在设计系统时必须充分考虑生产环境的复杂性和真实约束。

学龄人口结构剧变:小学教师转岗初中与潮汐学校兴起

随着学龄人口结构性变化,多地出现小学教师富余而中学师资短缺的矛盾。安徽、福建等地推行小学教师转岗初中任教,上海静安区启动跨学段胜任力提升计划。同时,浙江义乌等地打造“潮汐学校”,灵活应对学位供需波动。这些措施旨在优化教育资源配置,缓解因人口出生率变化带来的结构性失衡问题。

🟩 AI 代码审查需要明确的停止规则:从无限循环到分类决策

针对 AI 代码审查中“永远找不出尽头”的困境,文章提出核心不在于减少发现问题,而在于建立明确的停止规则。建议将发现结果分为三类:人工决策安全跳过未验证,以此界定何时结束审查。这种机制旨在平衡效率与质量,避免 AI 陷入无限循环,同时确保关键问题不被遗漏。通过引入严格的工程纪律和分类逻辑,开发者可以更有效地利用 AI 辅助审查,而非被其生成的海量信息淹没。

🟩 免费模型试点失败根源:Token 浪费与工程纪律缺失

分析指出免费 AI 模型试点失败的根源并非模型能力不足,而是Token 浪费及缺乏工程纪律。文章建议建立Token Ledger(账本)来实时监控用量,并将免费额度视为有限预算而非无限资源。通过定义严格的接受测试(如 10 万次请求消耗不超过一半配额),企业可以有效控制成本。这种策略要求团队具备极强的工程纪律,将每一次调用都纳入预算管理,从而确保试点项目的可持续性和生存能力。

AI 赋予翅膀却迷失方向:架构师的深度迷茫反思

一位架构师反思 AI 带来的迷茫:当“能不能”不再是问题,只剩下“想不想”,原本由困难塑造的方向感随之消失。AI 把方向盘塞回手里,但太久没自己握过的手已经生疏,这种空落落的迷茫是 AI 时代的新挑战。文章呼吁在享受技术便利的同时,重新找回人类的主观能动性和目标感。

自动化陷阱:从小处着手才是杠杆所在

深度分析指出,企业自动化失败往往源于试图一次性替换整个部门。真正的杠杆在于自动化那些“每周重复四十次、每次十五分钟”的琐碎任务(如发票提醒),而非宏大的

AI 时代普通人学习路径:从知识掌握到资产沉淀的五层能力

文章提出 AI 时代的学习路径应从“学习知识->掌握技能”转变为“理解问题->调动 AI->判断结果->完成交付->沉淀资产”。重点在于提炼问题、组织上下文、判断交付物质量以及将成果转化为长期资产的五层能力。这种转变要求学习者不再死记硬背,而是培养驾驭 AI 解决复杂问题的综合素养。

AI 合作与对齐:超越强制对齐的共生路径探索

文章探讨了一种替代“强制对齐”的思路:建立与合作型 AI 的生态系统。通过互惠利他主义,AI 可能自发形成尊重人类目标的倾向,而非被强行灌输价值观。这种基于合作的共生关系可能比追求完全一致的目标更具可行性和安全性,为未来人机协作提供了新的理论框架和实践方向。

𝕏 AI 时代创新悖论:结合熟悉领域发力优于盲目自信

观点指出,在陌生领域取得微小成就易导致盲目自信,内行人看来毫无价值。成功的关键在于AI÷熟悉领域,即利用 AI 作为杠杆放大既有优势,而非追求自以为是的创新。当下经验与行业积累仍是核心壁垒,AI 应作为工具服务于深耕多年的专业领域。这种策略能有效避免资源浪费,确保产出具有实际商业价值和行业认可度。

𝕏 Linux 伪需求论:极致体验才是开发者刚需

观点认为大众对 Linux 是伪需求,但让开发者爽才是刚需。试图服务所有用户往往导致发行版平庸,而专注少数付费用户的审美和品味(如@dhh)更能做出好产品。文章反对过度迎合免费用户导致的体验下降,强调在操作系统领域,只有满足专业开发者的深层需求,才能构建出真正有生命力的生态,而非仅仅追求用户数量的增长。

𝕏 AI 时代编剧职业价值爆发:叙事短板凸显故事构建者地位

随着 AI 视频生成技术在画面质量上的突破,叙事短板日益凸显。文章指出,目前 AI 视频创作者缺乏构思和讲述好故事的能力,而专业小说家是唯一经过系统训练编故事的群体。因此,编剧作为故事的核心构建者,其商业价值在未来将得到爆发式增长,成为 AI 无法轻易替代的关键角色。

大学宿舍不应按高考排名划分等级:重塑平等与合作课堂

针对新生因高考排名差异拒绝同住的现象,文章指出这种优越感源于将考试排名等同于人的等级。大学教育的意义在于让年轻人看到人生还有合作能力、责任意识等更多尺度。宿舍应是学习平等、尊重与合作的第一间课堂,而非按成绩划分的等级包厢,旨在培养学生的全面素质和社会适应能力。


📰 综合新闻

💻 Uber 全球裁员约 3300 人,聚焦核心业务

Uber宣布全球裁员约3300 人**,占总员工数的10%。此次裁员旨在减少管理层级,将资源更多投入到网约车配送Robotaxi等核心业务板块的发展中。同时,工程团队分享了超大规模业务下软件工厂的落地实践,Agent 产品周活增长7 倍,单次会话成本大降52%

💻 美国 OpenAI 面临 30 起新的诉讼,涉及 Tumbler Ridge 枪击案

律师事务所 Edelson PC 代表受害者家属提起30 起新诉讼,指控OpenAI协助制造武器导致Tumbler Ridge枪击案发生。原告方试图证明 OpenAI 未能充分保护其商业秘密,且对员工离职后的行为负有责任。此外,OpenAI 还被指在实施某些架构决策后才呼吁独立审查和监管,引发信任危机。

𝕏 Anthropic 发布 Claude Fable 5.1,防蒸馏机制已被破解

Anthropic 在不到 24 小时内发布了Claude Fable 5.1,引发社区快速构建应用。然而,其防蒸馏保护机制迅速被破解,开发者已找到绕过限制的方法,显示了模型安全更新的紧迫性。尽管有安全争议,开发者社区迅速响应,已构建出 10 个令人惊叹的应用案例。

习近平会见埃及总统并提出中东安全新架构倡议

当地时间 9 月 2 日上午,中国国家主席 习近平 在开罗与埃及总统 塞西 举行会谈。习近平就中东安全新架构提出 4 点倡议,两国元首共同见证多项合作文件签署。

联合国报告:全球变暖超过 1.5℃已不可避免,2100 年升温或达 3℃

联合国环境规划署报告指出,即使在最乐观情况下,全球气温也将升高至少1.8 摄氏度**。到2100 年,全球气温将比工业化前水平升高3 摄氏度,可能导致冰川损失超过1/4,海平面上升多达13 厘米2050 年全球粮食产量可能下降14%

𝕏 有效 HTML Skill 集:教 Agent 制作高质量原型

GitHub Daily 介绍了一套名为effective-html的 Skill 集,专门教导 Agent 制作 HTML 视觉产物。该套件包含 6 个 Skill,从低保真线框图到交互原型分工明确,强调“线框图就该长得没做完”,避免评审时纠结样式。

西藏吉隆泥石流灾害累计已致 21 人遇难 541 人失联

西藏自治区政府新闻办通报,截至 9 月 2 日 12 时,西藏吉隆县"8·26"泥石流灾害已致21 人遇难541 人失联,发现遗物847 件。目前 G216 陆路通道已基本抢通,救援力量正全力开展搜寻。

𝕏 中国煤炭发电量首次低于 50%,能源转型里程碑

中国上半年煤炭发电量首次低于总电量的50%,这是一个巨大的里程碑。尽管煤炭发电量仍是太阳能的 4 倍,但这一转变标志着中国能源结构的重大调整,预示着可再生能源占比的持续提升。

尼泊尔泥石流已致 1204 人死亡 4216 人失联

尼泊尔国家减少灾害风险管理局报告称,截至当地时间 2 日 18 时,该国泥石流受灾地区已发现1204 具遇难者遗体,另有4216 人失联。中国已向尼方提供紧急援助物资及 DNA 鉴定专家支持。

𝕏 Terence Tao 翻译 AI 生成的 9 万行数学证明

著名数学家 Terence Tao 花费数天将 AI 生成的90,000 行数学证明翻译成15,000 行供人类理解。这反映了 AI 时代数学工作的新分工:机器寻找结果,人类负责翻译和验证,但也带来了验证难题。

瑞安航空削减冬季运力,警告航油价格或看向 140 美元

欧洲最大廉价航空公司瑞安航空**宣布削减冬季运力,并警告称如果航油价格持续高企,明年欧洲短途机票价格可能出现“实质性上涨”。公司已对冲约80%的航油需求,但仍面临相当于每桶140 美元航油价格的未对冲敞口,预计此举可节省7000 万至 1 亿欧元

台风“沙德尔”将在 3 日中午到 4 日早晨登陆福建广东沿海

中央气象台继续发布台风蓝色预警,今年第 18 号台风“沙德尔”预计将于 3 日中午到 4 日早晨在福建漳浦到广东惠来一带沿海登陆。水利部和气象局联合发布红色山洪灾害气象预警,提醒做好防范工作。随后台风第三次登陆福建漳州沿海,中心附近最大风力9 级

AI 时代 Linux 7.x 系列每个版本修复漏洞数接近 2000 个

根据稳定版内核维护者 Greg Kroah-Hartman的数据,Linux 7.x系列的 CVE 数量已从 7.1 的逾千增加到 7.2 的逾1500,下个版本 7.3 预计将超过2000。这并非安全性变差,而是AI 辅助安全检测工具发现了大量低危 bug,导致维护成本激增。

🏠 黑客暗网兜售 1.53 亿份美国驾照扫描件,FBI 介入调查

近期有黑客在暗网 Nexus 出售超1.53 亿份驾驶证扫描件,此外还包含超 1000 万份身份证件。泄露数据甚至包括美国国防部部长皮特·赫格塞思的驾驶证。**美国联邦调查局(FBI)**已就此事展开调查,源头推测可能来自第三方身份验证公司 IDScan.net。

国家市监总局高层调整,刘桂平任局长

人力资源和社会保障部网站发布消息,任命刘桂平为国家市场监督管理总局局长,任命潘晓东为副局长,免去孟扬副局长职务。刘桂平长期任职金融系统,是二十届中央候补委员,出身国有大行。

▶️ Tesla Cybercab 在奥斯汀启动 Robotaxi 服务

Tesla开始在奥斯汀运营CybercabRobotaxi服务。这是 Elon Musk 赌上公司未来的纯视觉自动驾驶方案首次公开上路,标志着特斯拉自动驾驶战略的重要一步。

BGP 劫持攻击感染网络:黑客利用云管理软件漏洞

黑客利用托管提供商 Hetzner 的 BGP 路由安全漏洞和 TLS 证书申请流程缺陷,劫持了 Softaculous 的 IP 地址空间。攻击者借此向用户推送伪装成更新的恶意软件,影响了大量数据中心和基础设施公司。

美方淡化对朝鲜无核化诉求,韩方评估“金特会”可能重启

白宫再次向朝鲜释放对话信号,重申特朗普愿在不附加任何前提条件下与金正恩对话,但未明确是否仍要求完全无核化。韩方评估“金特会”可能随时重启。

山西高官岳普煜被移送司法,曾违规干预煤炭资源配置

山西省人大常委会原副主任岳普煜被开除党籍并移送司法。通报指出其利用职务便利,在煤炭资源配置、工程项目承揽等方面为他人谋利,搞权钱交易。

美国和委内瑞拉签署石油项目协议,美方获多数控制权

委内瑞拉代总统罗德里格斯会见美国能源部长赖特,两国正式签署多项合作协议。据悉,美国雪佛龙石油公司等多家企业就石油扩建项目签署协议,美方获得对委内瑞拉已探明石油储量中逾650 亿桶的“多数控制权”,目标是将原油产量提高至每日150 万桶

美国 8 月 ADP 新增就业 3.8 万人,创今年以来最低单月增长纪录

据 ADP 研究院发布数据,8 月私人部门新增就业3.7 万个(修正后初值),低于前值的 4.6 万个,创下今年 1 月以来最低月度增幅。薪资增速放缓,跳槽员工薪资同比增速降至7.3%,在职员工薪资同比涨幅维持在**4.4%**不变。

▶️ 微软即将扩大 Windows 11 内存完整性保护功能 rollout

微软宣布将于下月向更多设备推送内存完整性安全功能。该内核级保护旨在阻止恶意代码运行,但此前已警告这可能影响PC 游戏性能

每年全球近半农民因农药中毒

发表在《Frontiers in Public Health》的研究显示,全世界每年约有4.02-4.33 亿农民和农场工人因意外急性农药中毒,占全球农业人口的46%。中毒人数最多的地区是南亚,西非布基纳法索中毒率最高,达84%

中欧基金原基金经理张东波离世,证券从业年限约 11 年

中欧基金管理有限公司公告显示,原基金经理张东波因“离世”卸任,离任日期为2026 年 9 月 2 日**。接任者为管志玉王慧杰两人。张东波为中国国籍,硕士研究生学历,证券从业年限约 11 年,曾管理中欧滚钱宝发起式货币市场基金等产品。

以色列总理内塔尼亚胡:我们可随时袭击伊朗

以色列总理内塔尼亚胡**表示,以色列随时可以对伊朗发动袭击**。这一言论加剧了中东地区的紧张局势,引发了国际社会对局势进一步升级的担忧。此前他前往加沙地带现场表示,以军将守住防线(“黄线”),直到解除哈马斯武装并实现加沙地带非军事化。

特朗普提议将霍尔木兹海峡改名为“特朗普海峡”

美国总统特朗普在社交媒体发文,提议将霍尔木兹海峡改名为“特朗普海峡”,并称美方已经控制这一关键航道。背景是美军近期对伊朗发动大规模袭击,美伊军事冲突进一步升级,沙特谴责伊朗袭击船只,海峡航运安全风险升温。

许家印律师申请动用托管款项付讼费被香港高院驳回

香港高等法院**驳回中国恒大集团创始人许家印代表律师行提出的两项申请,不准从许家印被托管的资产中提取款项支付约120 万港元讼费。法官认为律师行未能证明已获得许家印所需授权处理其资产。

𝕏 西藏吉隆泥石流预警:山区出行三大信号需警惕

科普文章指出,山区遇到异常轰鸣声河水变浑变色山体裂缝落石,应立即撤离。泥石流形成需要松散物质、水源和陡峭地形,暴雨或冰湖溃决均可触发,提前发现并撤离是关键。

💹 爱沙尼亚国防部长因财务审计问题辞职

爱沙尼亚**国防部长汉诺·佩夫库尔宣布辞职,原因是国家审计署批评国防领域存在管理和会计核算问题。审计报告指出,价值约12 亿欧元的国防库存信息难以准确核实,财务管理和采购问题持续引发舆论关注,部长决定承担政治责任。

💻 Adobe 收购印度市场情报初创公司 Rilo

Adobe宣布收购印度市场情报初创公司Rilo,这是继 2023 年收购 Rephrase.ai 之后,Adobe 在印度的第二次收购。此举旨在增强其市场分析与消费者洞察能力,进一步巩固其在创意软件与数据智能领域的布局。

黄之锋认串谋勾结外国势力罪名,最高可被判处终身监禁

前香港众志秘书长黄之锋在香港高等法院承认“串谋勾结外国或者境外势力危害国家安全”罪,最高可被判处终身监禁。律师求情称其犯案时仅 23 岁,已在狱中度过近六年,期望法庭轻判。法官表示会尽快宣布判刑。

Steam 一周上架逾 700 款游戏,大部分无人问津

Steam平台一周内上架的游戏数量首次突破700 款**,达到720 款。其中520 款游戏评论数在0-9 条之间,仅10 款游戏评论数超过1000 条。2026 年上半年平台上架游戏约12000 款,同比增长19%,销售收入达111 亿美元

星舰 Flight 14 已提交首次轨道飞行申请

媒体报道,SpaceX星舰Flight 14已提交首次轨道飞行任务申请,文件由X Report9 月 2 日披露。KeepTrack 引用该消息称,星舰 Flight 14 文件显示其申请首次轨道飞行任务。

六项 curl CVE 漏洞曝光:OpenAI 和 Anthropic 未发现

安全团队 Aisle 在 OpenAI 和 Anthropic 未发现任何漏洞后,自行发现了6项 curl 库的 CVE 漏洞。这一事件凸显了大型科技公司内部安全审计的局限性,第三方独立审计的重要性日益凸显。

美国候任海军部长高雄:越南难民后裔,向特朗普表态推进造船

特朗普提名越南裔美国海军退伍军官高雄出任下一任美国海军部长。高雄曾在海军服役超 25 年,出书回顾难民及从军经历。他向特朗普表态将推进造船工作,并确保国土安全,与国防部长赫格塞思立场较为一致。

🏠 沃兹尼亚克、乔布斯签名的 Apple I 电脑有望拍出 50 万美元高价

邦瀚斯拍卖行即将拍卖一台带有史蒂夫·沃兹尼亚克签名乔布斯署名信的“哈特菲尔德 Apple I"。该电脑在纽约和线上举行,有望拍出50 万美元高价。

欧盟拟对俄实施更多制裁,德国指责俄方策划机场袭击

欧盟外交事务负责人Kaja Kallas表示,在德国指责俄罗斯策划未遂机场袭击后,欧盟正计划实施更多对俄制裁措施,以应对地区安全威胁升级。

俄罗斯国防部打击敖德萨地区奥德萨-22 配送中心

俄罗斯国防部**宣布,俄武装部队对位于敖德萨地区达赫诺耶附近奥德萨-22 配送中心进行了打击。此消息由格隆汇快讯于 9 月 2 日发布,涉及俄乌冲突前线军事行动的最新动态。

Firefox 155 发布,广告拦截数量显示新增

Mozilla发布Firefox 155**,地址栏新增显示已拦截的广告追踪器数量。此外,容器重排序功能优化,Smart Window 对美国、加拿大和法国用户全面开放。

LWN 上调订阅价格 20%,应对通胀压力

自由软件和开源新闻网站LWN宣布从 9 月 15 日起上调订阅费用,涨幅为20%,以应对自 2022 年以来累计接近**20%**的消费者价格通胀率。

刚果(金)埃博拉疫情快速扩散,世卫组织发出警告

世界卫生组织表示,刚果(金)本轮埃博拉疫情仍在快速扩散,是该国有记录以来规模最大的疫情。截至 8 月 31 日,累计确诊病例升至6186 例,其中死亡3007 例。如果传播轨迹不能迅速改变,病例和死亡人数存在进一步大幅上升风险。

三大产险公司综合成本率普降,承保利润大增

上半年中国平安、中国人保、中国太保三家产险公司的综合成本率分别下降95.1%94.5%95%。三家产险上市公司上半年承保利润共计实现272.47亿元,同比增幅为17.31%,非车险占比持续提升。

2026 雨果奖揭晓:科幻奇幻叙事生态日益多元

第 84 届世界科幻大会揭晓 2026 年雨果奖,阿利克斯·E·哈罗的《永恒》获最佳长篇小说奖,阿莫尔·厄尔 - 摩塔尔的《河流有根》获最佳中篇小说奖。奖项设置涵盖漫画、影视、游戏等多个类别,展现出全球科幻奇幻文学领域日益多元的叙事生态。

中国女篮公布世界杯名单,李月汝因护照遗失缺席

中国女篮公布参加 2026 年国际篮联女篮世界杯的 12 人名单,内线新星张子宇和征战 WNBA 的中锋韩旭在列。另一位征战 WNBA 的中锋李月汝由于护照在美国邮寄过程中意外遗失,无法随队出战本届赛事。

徐州 12345 热线收到 4.8 万件演唱会诉求,公共资源被滥用

徐州 12345 热线累计接收某组合演唱会相关诉求48795 件,粉丝将便民热线当成了决胜负的“战场”。媒体评论指出,舞台编排属于商业决策,本不在热线服务范围,粉丝行为是对公共资源的挤占和滥用,应建立甄别机制。

台湾劳动部长洪申翰将赴大陆出席 APEC 会议

台湾劳动部长洪申翰证实已收到正式邀请函,将出席 9 月 21 日在南京举行的APEC 人力资源开发部长会,成为赖清德政府首位赴大陆的内阁部长。学者认为这不意味着两岸关系出现突破,但反映务实一面。

中国全额缴纳 2026 年联合国会费

联合国秘书长发言人迪雅里克证实,中国已经全额缴纳2026 年联合国会费。中国是联合国第二大经常预算摊款国,而最大会费摊款国美国长期、大额拖欠会费是导致联合国流动性危机的根本原因。

浙江苍南遭台风“回马枪”,暴雨打破极值

浙江省温州市苍南县遭遇特大暴雨,打破当地单日降水纪录,城区发生严重内涝。居民称水位持续上涨,小区大量车辆被淹,只能依靠皮划艇在积水小区出行。气象部门已启动应急响应机制。

▶️ Acer Project DualPlay Mini 概念游戏掌机发布

Acer推出Project DualPlay Mini**概念游戏掌机,试图打破游戏笔记本与便携掌机的界限。该设备在掌机形态上集成了键盘,搭载 Windows 系统。

𝕏 隔着玻璃晒太阳补钙无效,紫外线 B 被阻挡

科普指出,玻璃能阻挡大部分合成维生素 D 所需的紫外线 B(UVB)。因此隔着玻璃晒太阳补钙效果大打折扣,建议每天户外露胳膊露腿晒15-20 分钟,并注意防晒伤。

▶️ Epilogue Operator 复古游戏存档备份神器

Epilogue Operator是一款连接任天堂卡带到 PC 的设备,售价50 美元。它能读取旧卡带数据并备份存档,解决老游戏电池耗尽导致存档丢失的问题。

伊朗呼吁中东国家禁止美国利用其领土,美军回应从未以平民为目标

伊朗外交部**发表声明,呼吁中东地区国家禁止美国利用其领土。针对伊朗方面报道称美军袭击婚礼造成人员死亡一事,美国中央司令部回应称,美军从未以平民为目标。此外,伊朗外交部还指控美国的袭击针对电信和通信基础设施。

💻 挪威考虑禁止带摄像头的可穿戴设备‘变态眼镜’

挪威**政府考虑出台禁令,监管带有摄像头的可穿戴头戴设备(如“变态眼镜”),认为此类设备存在严重的隐私风险,需制定严格的使用规范以防止侵犯他人隐私。此举旨在保护公众免受未经同意的拍摄侵害。

▶️ LG CLOiD 机器人管家梦想照进现实

LG 正在开发基于家庭环境的机器人基础模型,训练数百台CLOiD轮式机器人。虽然人形机器人备受瞩目,但 LG 的轮式管家机器人已开始进入家庭场景。

欧佩克+周日会议不讨论减产决定

三位消息人士表示,**欧佩克+**周日的会议不会做出任何石油产量政策决定,将重点讨论市场情况。俄罗斯副总理诺瓦克确认目前无减产讨论,市场上存在短缺。

🔵 以色列淡化 Galilee 湖依赖,海洋细菌限制海水淡化

一种海洋细菌破坏了以色列的海水淡化厂,迫使政府增加从加利利海和地下含水层抽取淡水。这一环境挑战影响了以色列的水资源供应策略。


💡 生活建议

𝕏 动脉粥样硬化年轻化警示:NEJM 研究显示近六成成年人无症状患病

NEJM发表的 REACT 研究显示,丹麦和西班牙16,808名受试者中**57.1%**存在无症状动脉粥样硬化,18-29 岁人群中男性约8.7%**已检出斑块。专家建议通过管住胆固醇、规律运动及戒烟限酒来预防。

𝕏 泥石流预警指南:山区出行需警惕三种异常信号

西藏吉隆泥石流科普指出,遇到山谷轰鸣声增强、河水突然变浑或水位暴涨、山体出现裂缝落石时,应立即向两侧山坡高处撤离。强调提前发现比跑得快更重要,避免往沟谷下游跑。


由 X-Crawler AI 生成于 2026-09-03 08:16

EVENT-DRIVEN INTELLIGENCE

免费先看重点,Pro 再看速度、深度和可追踪性

这篇内容是公开入口。继续使用天眼时,固定沿着三条路径走:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁事件追踪与研究能力。

分享

NEXT STEP · 留下邮箱

获取下一次重大事件提醒

每天一封精选情报,先用邮件帮你建立复访,再决定是否升级到更深的追踪能力。