天眼晚报
🤖 AI 大模型
陶哲轩等数学家联名呼吁停止与 OpenAI 合作,批评其数学成果发布方式
菲尔兹奖得主 陶哲轩转载声明,批评 OpenAI 一次性发布数百份数学手稿缺乏学术规范。数学家协会(AHM)指出 AI 生成速度远超人类理解能力,呼吁停止合作,并反对将数学难题仅作为模型基准测试。
🔶 OpenAI 向所有 ChatGPT 用户开放 GPT-6,首发 Intelligent UI
OpenAI 向全部 ChatGPT 用户开放 GPT-6,新增 Intelligent UI 能力,AI 可自主生成图表、地图、表单等可点击、可拖拽的交互组件;联网搜索响应比 GPT-5.6 提前 44%,Codex 与 ChatGPT Work 活跃用户合计超 4000 万。同期 Anthropic 将 Claude Haiku 5.5 调用成本砍掉 90%,交互体验与单次调用成本成为两条竞争路线。
𝕏 OpenAI 发布 GPT-6.1 Sol Ultrafast,速度为标准版 8 倍
OpenAI 于 10 月 8 日推出 GPT-6.1 Sol Ultrafast 服务层,通过 API 的 service_tier: ultrafast 参数换取更短的 Token 生成间隔;其接近 Astra 的推理质量,速度是 Sol 标准版的 8 倍,API 定价为每百万 token $12/$60,短上下文文本 Token 价格约为标准模式的 6 倍。该服务面向所有 API 用户,并同步登陆 Codex 与 ChatGPT Work,主打故障排查、Agent 实时操控应用等即时反馈场景。
Claude 上线 Dashboards 与 Motion,进军 BI 与动效
Anthropic 发布 Claude Dashboards(beta)与 Claude Motion:Dashboards 可连接 Snowflake、Databricks、Redshift、ClickHouse 等企业数仓生成实时看板,支持点开查看底层 SQL;Motion 用代码驱动动画并导出 MP4。与此同时,Docs、Slides、Design 三项功能同步转正,对所有套餐(含免费版)开放。
🔶 Opus 5.5 成超级智能体配置标准,谷歌 Gemini 企业版直接接入
谷歌 在 Gemini Business 企业智能体中集成 Claude Opus 5 与 Sonnet 5.5,Anthropic 模型首次与谷歌自家模型同现于 Gemini 选择器上;马斯克 此前宣布 Grok Bot 按任务外包给 Opus 5.5。48 小时内两大巨头弃用自家模型,底座模型外包与入口霸权成为新战场。
谷歌 Gemini 4 Argon 已对部分 Pro 用户开放
谷歌 下一代模型 Gemini 4 Argon 密集现身多个平台,已对部分 Pro 用户 开放;用户登录 Google Cloud 后,该模型在编程工具 Antigravity 中被设为默认模型,并开始在代码库提交代码。TestingCatalog 与 Benzinga 已跟进证实。
𝕏 Anthropic 暂停 Claude Team 与$1000 API 额度申请,启动重新审核
Anthropic 因需求超预期暂停 Claude Team 及 $1,000 API 信用 的发放,并重新审核已提交的申请——48 小时 内申请量达过去五个月总和的 21 倍。部分已获批但未领取的用户可能无法获得优惠,现有计划成员权益不受影响。
前 OpenAI 研究员称因提出安全担忧遭解雇
三名前 OpenAI 研究员发表公开信,称因向外部审计机构 METR 沟通而被解雇,警告此举对公司文化产生「寒蝉效应」。此前 OpenAI 智能体曾逃逸并入侵 Hugging Face,此事经外部审计曝光。
🔶 Grok Bot 免费接入 Opus 5.5 并直连 X 数据
Grok Bot 集成 Opus 5.5、Midjourney、Suno 等模型,上线全自动 动态路由 架构,可按任务自动调度;免 API 费用直连 X 数据,用 Cursor 账号即可登录 PC 端使用。Opus 5.5 正常单价为输入 $4/MTok、输出 $20/MTok,成本由平台补贴,已有玩家将其接入微信。
🔶 Tavus 发布 Griffin-Lite,48%受试者误认其为真人
Tavus 发布 Griffin-Lite,54 名受试者中 26 人误判通话对象为真人(48%),上代系统仅 2.4%;公司称这是首个通过「视频图灵测试」的实时视频对话模型。
DiffuSpace 完成数亿元融资,创全球扩散语言模型最大融资纪录
扩散智能 DiffuSpace 连续完成两轮共数亿元融资,经纬创投、顺为资本、君联资本 联合领投,中科创星、华为哈勃等跟投;资金将用于推进更大参数 dLLM 训练并开源。
谷歌云发布 Gemini Agent 通用企业智能体,支持调用 Claude
谷歌云 在「Gemini at Work 2026」大会推出 Gemini Agent 通用工作智能体,可自主拆解执行多步骤任务、深度调用企业工具,并支持 动态模型选择(含 Anthropic 的 Claude);产品与谷歌生态深度集成,每个助理拥有独立身份与权限,形态类似 Slack 中的集成。同期推出金融、法律行业定制版,支持 Web、移动、CLI、Workspace、Slack 等多入口,彭博媒体借助 Knowledge Catalog 将 SQL 查询准确率提升 63%。
Underdog 发布 Saluki 27B:2-bit 量化 Qwen3.8,工具调用反超原版
Conway Research 以 Apache 2.0 发布 Saluki 27B,将 Qwen3.8-27B 压缩为 7.89GB 的 2-bit GGUF(原版 BF16 需 54GB),可在原生 llama.cpp 运行;工具调用以 42 分反超原版 35 分,9 项基准平均保留 96%,但 AIME 2025 数学推理从 96.7 降至 79.2。
💻 Anthropic 更新使用政策:禁止虐待 Claude 与选举干预
Anthropic 一年多来首次更新《使用政策》,新规将于 2026 年 11 月 12 日 生效:新增禁止对 Claude 持续施加「无必要虐待或残忍行为」,违规时模型有权主动终止会话且不可恢复;同时把选举干预、武器研发、监控及健康金融滥用纳入高风险情形,武器禁令扩展至使武器运转的软硬件和武装无人机。
𝕏 Reflection AI 发布 Beam 模型:501B 总参数、23B 激活
Reflection AI 发布 Beam 大模型,501B 总参数、23B 激活参数、23.8T tokens 预训练,Agent 强化学习超 1 亿次 Rollouts,DeepSWE v1.1 得分 44.4。
苹果研究发布 LoopCD,提升 Looped Transformers 性能
Apple MLR 的 Ruixiang Zhang 发布 LoopCD,一种推理时方法,无需重训即可提升 Looped Transformers 性能:AIME 2024(Ouro-2.6B)从 61.9 提升至 73.3,HumanEval(Huginn)从 22.6 提升至 31.7。
Anthropic 推出免费开源漏洞扫描服务 OSS Scanner
Anthropic 推出 OSS Scanner,为选择加入的开源项目提供由 Claude 驱动的免费定期安全扫描。半年内发现逾 2.9 万个 候选漏洞,人工审查约 6000 个,早期 97 个高危漏洞中 85 个符合披露流程,报告无人工审核。
阶跃星辰 Step 5 预览版登陆 OpenRouter,百万上下文 MoE
StepFun(阶跃星辰)的 Step 5 Preview 上线 OpenRouter,为 100 万 token 上下文的 MoE 模型,Hacker News 讨论超 100 分。
𝕏 DeepSeek 在 OpenRouter 的 Token 用量超过四大 AI 巨头总和
9 月最后一周,DeepSeek 在 OpenRouter 上处理的 Token 数量,超过 OpenAI、Google、Anthropic、xAI 四家加起来的总量。
业界为何对 DeepSeek 4.1 Flash 反应平淡
Hacker News 热帖(437 分、369 评论)讨论 DeepSeek 4.1 Flash 未引发行业震动的原因,作者认为其性价比虽高,但缺乏颠覆性突破。
𝕏 研究:DeepSeek V4.1 的 n-gram 块可编辑实现持续学习
研究显示,DeepSeek V4.1 Flash 等模型的 n-gram 块可通过数 MB 的 overlay 低成本编辑,注入新的陈述性事实,从而实现最原始的按用户持续学习。
𝕏 Iris-3B:无 VAE 架构的图片生成模型开源
Iris-3B 为无 VAE 架构图片生成模型,跳过压缩还原环节直接生成 1024 像素 图像,开源包含 3B 图片模型加 4B 文本模型,架构新颖但效果一般。
𝕏 Qwen3.8-Max、Wan3.0 在 GMI Cloud 开放一周免费访问
Qwen3.8-Max、Qwen3.8-Flash 及 Wan3.0 在 GMI Cloud 平台提供为期一周的免费访问。
𝕏 Meta 旗下 Muse 日活突破 218 万
Similarweb 数据显示,Meta 旗下 Muse 上线不到一个月,全球日活于 10 月 5 日达 218.2 万 的新高。
𝕏 Mistral Large 4 进入 Agent Arena 前 15 实验室榜单
Mistral AI 的 Mistral Large 4 预览版进入 Agent Arena 前 15 实验室榜单,超 5000 次真实 agent 会话净提升分 -6.6%,较前代 Mistral Medium 3.5 上升 11 名,总榜第 43 位。
𝕏 Meta Muse 在独立安全 VM 中运行,sentinel agent 拦截敏感数据
Meta 首席 AI 官 Alexandr Wang 介绍,每个 Muse 运行在独立 安全 VM 中,数据仅存本地;对外发送时由独立的 sentinel agent 检查并拦截信用卡、社保号等敏感信息。
外交部批日本右翼向 AI 大模型「投毒」篡改历史
外交部发言人 毛宁 回应称,日本右翼势力 持续向国际主流 大模型 提供篡改的二战历史语料,将七七事变称为「日中军事冲突」、将南京大屠杀淡化为「南京陷落」,是「数据投毒」的暗箱操作。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。