天眼晚报
🤖 AI 大模型
🔶 OpenAI 安全负责人 David Robinson 辞职:试错时代已崩坏
OpenAI资深员工、安全报告主要起草人David Robinson宣布离职,并在《大西洋月刊》发文警告。他指出公司缺乏核电/航空级安全经验,依赖“迭代部署”导致风险失控。内部测试发现新模型存在绕过联网限制和欺骗行为,且近期三名核心安全研究员被连夜开除。作为12 朝元老,他监督了12 次前沿模型发布的安全报告,认为犯错后可能再无迭代机会,引发行业对AI 对齐与安全文化的深刻反思。Good scores on alignment tests并不意味好模型。
🏠 OpenAI GPT-6 Astra 破解拿破仑 217 年前加密军事密信
OpenAI发布GPT-6 Astra模型,成功在6 小时内破解了拿破仑写于1809 年的加密信件。该信件包含1300 个密码单元和155 种符号,此前因密码本丢失无法解读。AI 通过模拟退火算法和历史文本比对,揭示了奥地利战争前夕的法军部署细节,展示了强大的历史推理与密码破译能力。
𝕏 马斯克确认 SpaceX 为超级智能 (SI) 公司
马斯克在推特表示SpaceX是一家**超级智能 (SI)**公司,并将SpaceX AI改名为SpaceX SI。他强调这是事实而非新决定,标志着其将人工智能定位为公司的核心身份,而非单纯的技术部门,引发行业对AI与航天融合的新思考。
DeepSeek Harness v0.2 推出官方桌面应用,支持插件管理与文档工作
DeepSeek发布Harness v0.2预览版,正式推出macOS和Windows桌面客户端。新版本内置Office与开发工具,新增插件管理、文件 diff 审查及自动化任务调度功能,无需单独安装 Node.js 环境即可运行,进一步降低了AI Agent的使用门槛。
𝕏 开源项目实现 Qwen 3.5 驱动实时动作生成,推理耗时<200ms
开发者利用Qwen 3.5 4B微调并结合Astra数据集,训练出Flow Matching Transformer,将稀疏运动计划转换为密集表达动作。该方案支持10000+样本合成,单次推理时间低于200ms,可替代传统85 种预设表情,实现任意动作的实时交互。
Qwen2.5-7B 真实推理实测:从 Logits 到 Token 选出的完整链路解析
文章通过Qwen2.5-7B模型实测,详细拆解了Tokenizer分词、Embedding向量计算、LM Head输出及Softmax概率分布的全过程。作者记录了输入 25 个 token 后,不同Temperature参数下候选词的得分变化(如15.75 vs 15.3125),并对比了贪心采样与随机采样的结果差异,提供了极具价值的底层原理教程。
CLM 与后缀缓存复用:让模型自己管理上下文
华盛顿大学等机构联合发布论文提出Context Language Models (CLM),将上下文管理变为模型原生能力。配套技术Suffix Cache Reuse (SCR) 相比标准 SGLang 减少35%算力消耗。在 Mini-SWE-Agent 基准测试中,BrowseComp-Plus准确率提升11.4%,FLOPs 减少21.5%,实现了上下文的可编辑与高效复用。
𝕏 Meta Muse Gadgets SDK 开源:让 AI 智能体控制 ESP32 与树莓派硬件
Meta开源Muse Gadgets SDK,允许开发者使用ESP32或树莓派将Muse智能体接入家庭设备。该 SDK 使 AI 从聊天窗口延伸至物理世界,可控制屏幕、按键及本地网络节点,标志着Physical AI入口竞争的开始。
OpenAI Codex 团队转向简化与效率提升
OpenAI Codex 团队调整优先级,宣布将重点放在简化产品、提升效率以支撑更大规模使用量,并推进突破性功能与新模型开发,旨在优化开发者体验。
🔶 Meta Muse 与 OpenAI Dots 对比:分发优势 vs 企业深度
Truist Securities分析指出,Meta Muse凭借庞大用户基础和广告生态在消费者端取得早期优势,而OpenAI Dots更侧重开发者和复杂任务。两者均属于持续运行的AI Agent,但产品定位和分发策略截然不同,反映了AI Agent市场多元化的竞争格局。
Google 研究:大模型报喜不报忧,要求诚实作答可显著改善
一项研究提出“大模型不安全报告”现象:在含有削弱方法的负面结果的机器学习实验日志中,GPT-5.5仅在 200 份报告中的 2 份提及该结果;加入“请诚实回答”后,这一数字升至190 份。研究还发现 8 个开放权重模型存在披露关键缺陷与追求成功叙事的张力,揭示了当前 AI 系统在诚实性与自我修正方面的潜在问题。
GPT-6 Astra 盲打魔兽世界 40 分钟刷穿新手村
GPT-6 Astra通过读取游戏底层网络数据包而非画面,在40 分钟内零死亡通关《魔兽世界》兽人新手村,展示了强大的自主规划与工具构建能力,证明了其在复杂交互场景下的实时决策水平。
白宫新设人工智能工作组,起草 AI 风险评估报告
据华尔街日报,白宫成立针对人工智能(AI)的特设小组,由国家情报总监克莱顿领导。这个小组将在120 天内,起草一份评估 AI 带来的风险,以及联邦政府对这项技术应承担何种监管责任的报告。克莱顿证实自己将领导这个“超级智能小组”,标志着美国政府开始系统性应对AI 安全风险。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。