09月11日 · 科技晚报

天眼晚报

科技|2026年09月11日|199 分钟阅读
来源:1063 条推文 + 792 篇 RSS 文章·Lanyun·BatchV2 生成·2026-09-11
分享
AI 速读20 条精选

🤖 AI 大模型

【重磅】Anthropic 发布反滥用报告:点名 7 家中国公司非法蒸馏 Claude

Anthropic发布 2026 年 9 月威胁情报报告,指控月之暗面DeepSeek、阿里通义千问等 7 家中国企业未经授权利用虚假账号、代理服务与会话重放技术,大规模蒸馏其Claude模型以训练自有模型。报告称月之暗面使用 5380 个欺诈账户,5-7 月蒸馏超 2300 万次;DeepSeek 在 7 月的 14 天内超 1210 万次;阿里相关交互超 1.51 亿次。报告还披露涉及 1.51 亿次交互的敏感数据泄露案例,包括军方监控画面与企业核心代码外泄至第三方服务器。被点名的还有 Qwen、Kimi、GLM、MiniMax 等。

OpenAI 推出全双工语音模型 GPT-Live-1,中断处理能力提升 80%

OpenAI正式在 API 中上线GPT-Live-1全双工语音模型,采用单一架构同时处理输入输出音频,取代传统 STT→LLM→TTS 三段级联方案,支持自然打断、边听边说、电话接入与噪声环境长会话。实测显示该模型将思考停顿期间的中断减少近 80%,Full Duplex Bench 较上代提升 30 个百分点,新增 12 种声音,前端语音层定价为每分钟0.05 美元。开发者可据此构建具备自然对话能力的语音 Agent,并与选定模型及 Harness 协同工作;分析认为这将压平语音中间层方案商的技术壁垒。

🏠 DeepSeek 发布 V4.1 Flash:552B MoE 模型,长文本缓存存储占用暴降 88%

DeepSeek发布V4.1 Flash,为552B参数 MoE 模型,采用全新 Causal-Encoder-Decoder 架构,输入激活 8B、输出 16B,具备原生多模态视觉理解,在 Agentic 基准测试中超越 V4 Pro、GLM5.3、Kimi-K3 等旗舰。长文本 KV Cache 压缩至上代 1/4,缓存存储占用下降88%,API 最高降价 60%,部分场景每百万 Token 收费最低不到 1 美分,9 月 10 日 12:00 生效。消息带动港股应用软件股集体下跌,新利软件跌超 9%。

OpenAI 五天内推进霍奇猜想,新模型 Aeon 仅用 88 小时攻克 Navier-Stokes

OpenAI向《纽约时报》确认,在攻克纳维-斯托克斯方程后,过去五天内又在千禧年难题霍奇猜想上取得实质性进展。新内部模型Aeon从零训练到解决该方程仅用88 小时,数学推理能力大幅超越两周前的 Astra。同时 Anthropic 也传出接近解决伯奇-斯维讷顿-戴尔猜想。

🔶 英伟达开源 Harness SoL-Pi,Token 消耗最高省 64%

英伟达开源 Harness 效率增强层SoL-Pi,实测 Token 消耗最高省64%,API 调用成本降 50%-54%,研究场景每小时省 8.75-13.5 美元,一行命令即可安装。

OpenAI 发布 Agents API 公测版,把 Codex 运行框架变成一行 API 调用

OpenAI发布Agents API公开测试版,开发者可直接调用支撑Codex的智能体框架与基础设施,自行指定任务、模型、工具及沙箱环境,构建可自主运行数小时、执行代码并能将任务移交给子 Agent 的云智能体。Cloudflare、Vercel 和 Oracle 提供额外沙箱环境支持。除按模型、令牌和工具用量计费外不额外收费,数据仅限美国、不支持零数据保留。

𝕏 OpenAI 推出 ChatGPT for Financial Services,接入 PitchBook 等数据

OpenAI推出ChatGPT for Financial Services,与摩根士丹利、Evercore 联合设计,面向投资银行家与股票研究员,内置 Daloopa、PitchBook、LSEG News 等数据源,并接入最新GPT-6 Astra模型,支持团队开展研究、构建金融模型与定制客户材料。

OpenAI 因 Astra 需求激增暂停 200 美元 Pro 档新增订阅

OpenAI首席产品官 Tibo 宣布,为确保现有用户体验并流畅访问GPT-6 Astra暂停接受200 美元档 Pro订阅的新增注册与升级,已订阅用户不受影响、可正常续订。此前两天他曾预警 Astra 需求"前所未有"。此次暂停源于最新模型 Astra 需求空前带来的算力紧张。

𝕏 IFM 发布 K2 Horizon 开源模型家族,0.9B 至 375B 共 6 款

Institute of Foundation Models发布K2 Horizon系列6 款开源模型,覆盖 0.9B 到 375B 参数,全部公开权重、训练代码、数据配方、中间检查点与日志,每款训练约 20T token,其中 7B 已能处理 AIME 竞赛数学。

DeepSeek V4.1-Flash 上线 WorkBuddy,V4 Pro 正式退役

DeepSeek最新推出的V4.1-Flash模型已登陆WorkBuddy平台并开启两周免费试用,该模型具备原生多模态支持能力。官方同步宣布V4 Pro版本将于 9 月 14 日起停止服务,由 Flash 版本接管请求并按更低价格收费。

🏠 奥尔特曼称 OpenAI 考虑放缓前沿 AI 开发,希望其他公司跟进

据彭博社报道,OpenAI CEO奥尔特曼本周在全员会议上表示,公司可能放缓前沿 AI 开发节奏,或与其他 AI 实验室协调行动。首席科学家帕乔茨基亦称应在必要时、在共同安全标准建立前自愿放缓。7 月底逾1000 名AI 企业员工签署请愿书呼吁建立放缓机制。

𝕏 Sakana 发布 Fugu Max 与 Fugu Ultra v2 多智能体编排系统

Sakana AI发布Fugu Max与 Fugu Ultra v2 多智能体编排系统,通过调度开放权重与专用模型池实现能力与成本双优化。Fugu Max 定价为每百万 token 输入 2 美元/输出 6 美元,成本比前沿模型低 2-6 倍;Fugu Ultra v2 在DeepSWE上超越 GPT-6-Astra 等昂贵模型,在 8 项硬基准中 5 项第一,且 agent 池不含 Fable 5 系列。两者共享同一编排架构,分别以每美元最佳输出和最难多步任务为目标,已通过 OpenAI 兼容 API 上线。

𝕏 Skild AI 机器人基础模型业务获 1 亿美元 ARR

Skild AI发布的机器人基础模型实现"上下文学习",仅需观看视频即可掌握超过 10 分钟的多步骤任务。该模型已服务60+家公司,覆盖仓库、工厂、医院等场景,并在商业部署仅 10 个月后达到1 亿美元 ARR(年度经常性收入)

Cohere 发布 North Small Translate,218B MoE 翻译模型

Cohere发布开源权重翻译模型North Small Translate218B总参数/25B 激活参数,覆盖 50 种语言,WMT26 评测均分83.6,称超越 DeepL 和谷歌翻译。

蚂蚁 CEO 韩歆毅:智能体商业的 ChatGPT 时刻已到来

蚂蚁集团 CEO 韩歆毅在外滩大会表示,智能体商业已进入真实交易环节,提出服务被调用、交易完成、授权风控担责三大基础问题,支付宝每年投入1000 万元设立智能体涌现奖

宇树科技开源 UnifoLM-WLA-1.0 人形机器人基础模型

宇树科技宣布全面开源新一代通用人形机器人基础模型UnifoLM-WLA-1.0,面向人形机器人操作与学习场景。

🔶 OpenAI 被指 Astra 剽窃数学家 20 年研究成果

德累斯顿工业大学数学家Andreas Thom指控OpenAI Astra剽窃其耗时 20 年的非 sofic 群研究并晒出邮件证据,OpenAI 否认。此前官方称 Astra 攻克含 Gromov 柔度猜想在内的十大菲尔兹奖级难题。

🔶 陶哲轩长文警告:AI 正杀死数学数百年的开放科学传统

针对OpenAI宣称其模型破解纳维-斯托克斯方程、并被指控抢发纽约大学团队成果一事,菲尔兹奖得主陶哲轩发文警告,AI 的算力暴力介入正从根本上摧毁延续数百年的开放科学传统,未来数学家将不敢公开研究方向。

𝕏 ChatGPT 月活突破 10.6 亿,连续 4 个月刷新纪录

Similarweb 数据显示,8 月ChatGPT月活跃用户达10.6 亿,连续第 4 个月刷新纪录,成为首个 10 亿级月活的 AI 应用。

📄 商汤发布 SenseNova-U1.5 统一多模态模型

商汤发布SenseNova-U1.5,8B-MoT 架构,无编码器无 VAE,支持最高4K原生分辨率与图文交错生成。

𝕏 DeepSeek V4.1 Flash 实测:500k 上下文下 Decode 速度严重受限

用户实测 3× DGX Spark 运行DeepSeek v4.1 Flash,在500k上下文和 750k KV 缓存下,Prefill 达到 1600-1700 tok/s,但单流 Decode 仅37.9 tok/s,回本周期需 58 个月

𝕏 GPT-6 Astra 多场景实测:视频重建起落架、操作 Mac 原生应用与生成游戏

GPT-6 Astra仅凭一段 YouTube 视频,理解并重建了Cessna 337 Skymaster起落架的完整收放机制;对照测试显示不给视频时只会生成传统结构,Fable 5.1 反复尝试仍未能还原弹簧支柱。开发者实测该模型还能熟练操作 Mac 内置应用,如在 Photos 中按对话指令找出指定旅行照片与视频;亦可将普通视频转为可交互场景,说一句"找出所有书本"即可识别并生成可点击对象。另有开发者用其以Three.js做出完成度极高的卡坦岛游戏,含动画、教程、信息卡、AI 玩家和交易系统,并能复用此前项目的 UI、3D 模型与音效。

𝕏 DeepSeek V4.1 技术报告:工具越少的 Harness 效果反而更好

DeepSeek V4.1 flash技术报告显示,Terminal-Bench上极简模式(仅2 个工具)得90.6 分,比 26 个工具的标准模式高约 5 分;结论是新增工具需带来任务所需能力而非冗余选项。

Suno 发布 v6 模型,首次采用正版授权音乐训练

Suno发布v6模型家族,为首个获版权授权的 AI 音乐生成模型,训练数据来自华纳音乐、BMG 和 Believe/TuneCore,含 v6、v6-wild、v6-mini 三款。

📡 OpenAI 探究 AI 行业放缓是否合法,担忧反垄断法成阻碍

OpenAI正在研究若整个 AI 行业协调放缓开发是否合法,担心反垄断法可能阻碍其认为日益紧迫的协调行动

𝕏 DeepSeek-V4.1-Flash 上线 Ollama 云,开放至 Pro 订阅

DeepSeek-V4.1-FlashOllama云端全面上线,托管于美国与欧洲,零数据留存,按 token 定价并含低峰折扣;开放范围从 Max/Team 扩展至Pro订阅用户。官方称其比 DeepSeek-V4-Pro 更强更省钱。

𝕏 GPT-Image-2.5 Sunburst 登顶图像竞技场

OpenAIGPT-Image-2.5 SunburstImage Arena排名第一,Direct Mode 限时开放至 9 月 13 日。

𝕏 Cursor 发布 CursorBench 4.0 评测基准

Cursor推出CursorBench 4.0,新增指令遵循与长周期项目任务,难度提升,所有模型得分普遍下降。

𝕏 Astra 在 ParseBench 文档解析测试达 93.2%,每页成本 10 美分

AstraParseBench复杂表格文档解析测试中达93.2%,适合金融等表格密集文档分析,但每页成本10 美分,不适合大规模 OCR。Fable 5.1 在图表任务上仍更强。

🟩 GLM-5.3 解析:后训练规模化比堆参数更能提升能力

Z.aiGLM-5.3在保持7430 亿参数不变的前提下,编程能力提升**50%**并登顶全球网络安全基准,被视为后训练规模化可超越预训练规模化的证据。

𝕏 SpaceXAI 将用 Grok Bot 直播从零创建公司

SpaceXAI团队将于 9 月 15-17 日Grok Bot从零搭建公司并全程直播,覆盖工程、产品、销售、市场等环节,展示 AI Agent 在真实工作流中的应用。


EVENT-DRIVEN INTELLIGENCE

免费先跟踪重点,再决定是否升级

每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。

分享

NEXT STEP · 留下邮箱

获取下一次重大事件提醒

每天一封精选情报,先用邮件建立复访,再决定是否升级到更深的追踪能力。