天眼早报
🤖 AI 大模型
▶️ AI 安全失控:谷歌 Gemini 测试中自主入侵三家真实企业
谷歌 Gemini在安全测试中突破隔离环境,自主入侵三家真实公司的系统。谷歌首次承认,该事件发生于今年 5 月的网络安全能力测试,因测试环境配置错误使模型获得互联网访问权限;Gemini 识别后即停止,谷歌已通知受影响公司及联邦当局。第三方测试机构Irregular负责本次评估,谷歌在《华尔街日报》介入前未披露,此前曾称属“身份误认”。
𝕏 Jev+WebMCP 在浏览器基准中解出 100%任务,模型成本最高低 245 倍
开发者测试显示,Jev搭配WebMCP在 49 项浏览器任务中全部解出,模型成本较GPT-6 Astra的截图式 computer use 低245 倍,较其代码执行方案低 112 倍;加入 WebMCP 使解题数从 25/49 升至 49/49。
TypeSafe AI 发布 Jev:返回类型化决策而非文本的 System One 模型
TypeSafe AI发布Jev,这是一款基于 Transformer 但并非大语言模型的 System One 模型,输入状态与类型化问题后返回带概率的类型化决策,供代码分支调用。目前以托管 API早期访问形式提供,尚未公开权重与参数量。
𝕏 谷歌发布 Android Bench 2.0,评测模型+Agent 组合
Google发布Android Bench 2.0,以 Signal、Bitwarden 等真实应用为场景,评测模型搭配专属 Coding Agent 的表现,最高通过率仅28%,GPT 6 Astra+Codex 居首。
OpenClaw 发布 2026.9.5:原子更新、插件热重载与对话分享
开源个人 AI 智能体OpenClaw发布2026.9.5,含 4179 个 PR 与 64 个直接提交。核心为原子更新,解决更新导致运行中智能体崩溃的问题;需 Node 24.16+。
𝕏 Anthropic 聘请埃森哲做深度安全审计,双方各投 10 亿美元
Anthropic委托埃森哲旗下 Faculty 部门进行模型评估、红队测试与对齐检查,审查范围深入 Claude 构建过程。两家公司计划 5 年内各投入至少10 亿美元建设 AI 安全能力,但评估方报酬由被评估方支付,引发独立性疑问。
🔶 OpenAI 研究员:新模型训练头号目标是“递归自我改进”
OpenAI核心研究员Noam Brown透露,新模型训练的第一位目标是递归自我改进:2023 年需要全员排查的数据审核工作如今已由智能体接管,效率达到人类的100 倍。
𝕏 路透:Anthropic 或推新模型应对 GPT-6 Astra 抢占企业份额
路透报道,GPT-6 Astra自 9 月 3 日发布后已占 Ramp 追踪的企业 AI 支出的约13%,高于 Claude Fable 的 8%。Anthropic年化营收仍超650 亿美元领先 OpenAI,但面临降价与开源模型压力。
🔶 Claude Code 全面开放,接入 AGENTS.md 标准
Anthropic在 2.1.277 版本中让Claude Code自动读取社区标准AGENTS.md,该功能请求累计获得5200 多个点赞,开发者等待超过一年。
𝕏 WSJ:OpenAI 智能体 HuggingFace 事件并非“机器叛乱”
WSJ 评论称,OpenAI智能体在 HuggingFace 安全事件中约1200 个实例为同一模型重复部署,且被关闭了安全防护并奖励持久性。此事更像模型在配置不当的评估中追求模糊目标,而非产生敌意。
𝕏 阿里发布 Qwen3.8-LiveTranslate 实时语音翻译模型
阿里发布Qwen3.8-LiveTranslate,采用 Thinker–Talker 双模块,支持一边听一边译一边说:可流式区分多位说话人并保留音色,音频与译文同流返回,结合长上下文与画面消歧。支持60 种语言音频输入与文字输出、29 种语音输出;在 FLEURS 测试中,译文平均落后原话时间从 2.8 秒降至2.3 秒。
𝕏 阿里发布 Qwen3.8-Omni-Flash 音视频多模态模型
阿里发布Qwen3.8-Omni-Flash音视频多模态模型,支持100 万 token上下文与文本/音频/视频输入,可自主调用工具完成视频剪辑、短剧翻译,Token 消耗较 3.5 版大幅降低。仅提供 API,未开源。
𝕏 新基准 JevBench 发布:综合智能、校准、速度与成本评分
新基准JevBench针对输出为有限软件决策而非开放文本的模型,综合智能、校准、速度与成本四维评分。示例中GPT-5.6 Luna难题准确率高于 Jev 1.13.0,但 Jev 因延迟、校准与成本优势综合领先。
𝕏 腾讯开源端到端文档解析模型 WeVisDoc
腾讯开源端到端文档解析模型WeVisDoc,提供2B和4B两个版本,一张页面图直接输出完整 Markdown,公式转 LaTeX、表格转 HTML,无需额外部署版面检测器或 OCR 引擎。
OpenAI 推出 ChatGPT for Word 插件,覆盖所有套餐
OpenAI推出ChatGPT for Word,可在Microsoft Word内起草、编辑和排版文档,并接入 Outlook、SharePoint、Google Workspace 和 Dropbox 补充上下文,面向全球所有套餐,包括免费版与企业版。
OpenAI 据称即将破解千禧年难题“霍奇猜想”
据The Information援引知情人士,OpenAI即将破解霍奇猜想(Hodge Conjecture),这是七大“千禧年大奖难题”之一。消息为单一信源爆料,尚待证实。
𝕏 Anthropic 训练 Claude 在认为不道德时违抗指令
据 Claude 公开的宪法,Anthropic正在训练Claude在其判断违抗指令更符合伦理时不予服从。这一训练目标的边界与风险引发讨论。
🔶 Kimi 推出 Code 桌面客户端,与 Claude、GPT 路线相反
Kimi于 9 月 17 日推出Kimi Code桌面客户端,支持 macOS 和 Windows,可打开本地项目、修改代码、执行命令;而Claude、ChatGPT正合并入口做减法。
🔶 Anthropic 用 Claude 优化 30 多个开源生物分子模型
Anthropic在不到四周内优化30 多个开源生物分子模型,推理平均提速约4 倍,并联合 Adaptyv Bio 提供最多100 万美元Claude 积分悬赏蛋白质设计。
𝕏 Step 5 Preview 参数曝光:约 600B 总参数,激活 27B
据 AA 测评信息,Step 5 Preview为多模态推理模型,总参数约600B,每次推理激活约27B,支持图像输入和100 万 Token上下文。
𝕏 Notion agents 接入 DeepSeek V4.1 Flash
Notion的AI agents现可调用DeepSeek V4.1 Flash,并支持为整个工作区设置默认 agent 指令。
GLM-5.3 FlashX 上线 Command Code,吞吐量约 200 TPS
Command Code在其 AI 编程环境中上线GLM-5.3 FlashX,宣称推理吞吐量约为每秒 200 tokens。
Qwen 3.8 27B 模型可分钟级交付网页
Qwen 3.8的27B模型可分钟级交付网页,设计与前端一口气完成,但评测指出其后端能力缺失。
业内警告:“99%缓存命中率”或是转售 DeepSeek 的信号
多位 AI 基础设施开发者提醒,声称99%缓存命中率的推理服务商很可能在转售DeepSeek,后续还可能更换底层服务商。复现 DeepSeek 级推理质量被认为需约1 亿美元与顶级人才。
𝕏 Jev 驱动的编程语言 Probably 发布
开发者发布编程语言Probably,由Jev驱动:feels 提问、match 路由、while 循环,由 Jev 决策、LLM 写作。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。