09月12日 · 科技早报

天眼早报

科技|2026年09月12日|124 分钟阅读
来源:820 条推文 + 427 篇 RSS 文章·Lanyun·BatchV2 生成·2026-09-11 — 2026-09-12
分享
AI 速读20 条精选

🤖 AI 大模型

OpenAI 推出 Agents API 公测版,并接入 Box Mount 支持企业内容

OpenAI于 9 月 10 日推出Agents API公测版,一次调用即可创建生产级云端智能体,可选托管沙箱、自有基础设施或合作伙伴环境。基于开源Codex harness,支持长会话上下文压缩、工具搜索、并行工具调用与子智能体协作,公测期不额外收费。同时,Box Mount将企业内容以文件形式带入沙盒,支持普通 shell 命令读写与双向同步;演示中一个主 Agent 挂载交易室、读取5 个源文件、并行启动3 个专业 Agent 并写回4 份报告。

𝕏 Anthropic 发布 AI 滥用报告:拦截生物危害请求,指控 7 家中国实验室蒸馏 Claude

Anthropic发布威胁情报报告,称已阻止使病毒更危险的请求,披露5 个生物案例(含禽流感研究、军事研究机构牵涉的基孔肯雅热项目),并识别出涉及7 家中国实验室的未授权蒸馏行动。其中阿里巴巴月之暗面、DeepSeek、智谱、小米、商汤、MiniMax 等被指控大规模调用Claude进行“蒸馏攻击”,阿里 5 月至 7 月产生超1.51 亿次交互,高峰期每天接近300 万次。报告还称 DeepSeek 和 Moonshot 将客户请求转发给 Claude 并以其名义输出结果。

𝕏 DeepSeek-V4.1-Flash 上线 Hugging Face,采用 YOCO 解码器-解码器架构

NovitaHugging Face上线DeepSeek-V4.1-Flash552B参数主干、原生图像与文本输入、最高100 万 token上下文,推理强度可连续调节。YOCO为 DeepSeek-V4.1-Flash 的架构,采用解码器-解码器设计,旨在降低 GPU 显存与预填充延迟。

𝕏 IFM 发布 K2 Horizon 系列 6 个开源模型

基础模型研究所(IFM)发布K2 Horizon,含0.9B375B共 6 个开源模型,覆盖端侧到推理编码。0.9B/3.7B/7B 在同尺寸创 SOTA,稀疏 36B-A4B 采用新Mixture-of-Value Attention架构。同步开放权重、训练代码、中间检查点与完整数据配方。

𝕏 DeepSeek V4.1 Flash 发布首日:NVIDIA vLLM 全 SKU 可用,AMD 镜像 23 小时未发布

SemiAnalysis指出,DeepSeek V4.1 Flash发布首日,NVIDIA vLLMH100、H200、B200、B300、GB200、GB300六个 SKU 零问题即插即用;而AMD vLLM 仍不支持,其文档指向的 ROCm 镜像发布23 小时后仍未公开。

𝕏 Cognition 发布 Devin Fusion 多模型编程智能体

Cognition发布Devin Fusion,为首个进入Artificial Analysis编程智能体指数(1.5)的多模型智能体。搭配Claude Fable 5.162分,搭配GPT-6 Astra快**31%且省43%**成本。

𝕏 OpenAI 发布 GPT Image 2.5 Flare 与 Sunburst

OpenAI发布GPT Image 2.5两款图像模型Flare登顶文生图、Sunburst登顶图像编辑榜。Flare 延迟较GPT Image 2降低63%,价格维持每百万输出 token30 美元

𝕏 OpenAI 将生物推理模型 GPT-Rosalind 移出研究预览,面向全球开放

OpenAI宣布GPT-Rosalind结束研究预览,面向全球符合条件机构开放,通过APICodexChatGPT Enterprise提供受信访问,并包含后续发布的 GPT-Rosalind 新模型。Codex同步上线基因组、蛋白结构等生命科学插件。

𝕏 传 Altman 告知员工 OpenAI 或放缓前沿模型开发

Bloomberg报道,Sam Altman告知OpenAI员工公司可能放缓前沿模型开发,或与其他 AI 实验室同步;OpenAI 已暂停面向部署的强化学习训练两周,并推迟最大规模的前沿 RL 运行以测试更强保障,其监控系统约消耗**20%**额外推理算力。

𝕏 OpenAI 在 API 上线 GPT-Live-1,端到端实时语音模型

OpenAI在 API 发布GPT-Live-1,不再级联拼接 STT、语言模型和 TTS,而是把输入输出音频作为一次连续交互推理,支持全双工电话、向第三方模型委派工具调用,并可用系统提示词控制语气与节奏。

𝕏 蚂蚁集团开源 Ling-3.0-flash-VL,124B MoE 支持图像视频理解

蚂蚁集团开源Ling-3.0-flash-VL124B总参数仅激活5.5B,支持256K上下文与图像/视频输入,MIT 许可。智能指数得分 25,位居智能-激活参数帕累托前沿。

月之暗面年底年化收入目标 20 亿美元

月之暗面告知投资者8 月年度经常性收入已突破10 亿美元(6 月为 3 亿),跃升得益于 7 月发布的Kimi K3。公司内部预测今年底年化收入将再次翻番至20 亿美元

𝕏 Sakana AI 的 Fugu Max 上线 OpenRouter

Sakana AIFugu Max上线OpenRouter,为学习型多 Agent 编排引擎,在开源权重与专用模型间路由任务,定价2 美元/6 美元每百万 token,支持多模态(图像/PDF)、网络搜索、函数调用与结构化输出。

𝕏 DeepSeek V4.1 Flash 成本优势实测:FlappyBench 最优,落地页成本仅为 Claude Fable 5 的 1/40

FlappyBench测试显示,DeepSeek V4.1-Flash以最低单次成本拿到9/10GLM 5.3获 9.5/10 且界面更精致但成本翻倍;Kimi K3仅 8/10,成本达8 倍。另一项测试中,同一电影院落地页提示词下,DeepSeek V4.1 Flash 成本2.6 美分Claude Fable 5成本1.21 美元,质量相近但便宜40 倍以上。

𝕏 DeepSeek V4.1 在 LiveBench 排名第 5,Agentic Coding 登顶

DeepSeek V4.1LiveBench上排名第 5,仅次于 Astra、两款 Fable 和 Muse Spark 1.3,其Agentic Coding能力排名第 1,领先 Fable 5.1 约 11 分。有分析指出,DeepSeek V4.1 在 LiveBench 代理编程子项超出预期2.7 个标准差,但该结果仅基于 1270 道评测题中的4 道 Python 题,统计意义存疑。

实测争议:DeepSeek V4.1 Flash 官方基准超越 GPT-5.6 与 Opus 5

DeepSeek V4.1 Flash官方基准显示其在DeepSWE等编程基准上超过GPT-5.6 SolOpus 5;作者实测复刻 3D 版《坦克世界》,指出实际效果与官方基准存在差距。

𝕏 Claude Fable 5.1 在 InferenceBench 创 9.83 倍加速新纪录

Claude Fable 5.1InferenceBench上取得9.83 倍几何平均加速,刷新 SoTA 并超过此前的Opus 5,提升主要来自推理策略而非新硬件。

𝕏 OpenAI 分享:GPT-5.6 Sol 配合 Codex 加速量子芯片实验设计

OpenAI分享 MIT EQuS 课题组研究者Bea Yankelevich使用GPT-5.6 Sol配合Codex在量子芯片上执行常规测量,加速实验设计。

DeepSeek 继续提供 V4 Pro API 服务,并发布 V4.1 Flash 多模态模型

DeepSeek宣布 2026 年 9 月 14 日后继续提供V4 Pro API 调用服务,计费方式不变,此前原计划当日下线。同时公司 9 月 10 日发布原生多模态V4.1 Flash,基准测试表现超越 V4 Pro 等旗舰模型。

𝕏 GitHub Copilot 为 Pro+和 Max 用户提供 GPT-5.6 Sol 七折

GitHub宣布GPT-5.6 SolGitHub Copilot中对 Pro+和 Max 订阅用户降价30%,优惠将于9 月 13 日 00:00 UTC结束。

𝕏 马斯克:Grok 4.7 几天后发布,仍在优化

马斯克表示Grok 4.7将在几天后发布,称其在能解决的高难度任务上过早放弃、检查工作的严谨性不足,目前仍在优化。

𝕏 SWE-2 需求超预期致算力短缺,免费推广延长至 10 月

SWE-2因需求远超预期出现容量短缺,官方宣布将免费推广活动延长至10 月,并正在扩充算力。

𝕏 Qwen 3.8-Flash-Next 据称以 1/4 规模达到 DeepSeek V4-Flash 同级

有开发者指出,Qwen 3.8-Flash-Next在 AA 榜单上与DeepSeek V4-Flash同级,但模型体积小近4 倍、激活参数少近3 倍,若属实则被严重低估。

𝕏 用 GPT-6 Astra 将 11 分钟访谈一键切成 6 个观点切片

有用户用GPT-6 Astra Ultra结合Qwen3 ASR一条提示词将 11 分 30 秒的访谈视频自动切成6 个观点切片,并预判月薪1 万元左右的剪辑岗位将受冲击。

银行 Agent 上岗:4200 万小微经营者可用

量子位报道,银行Agent上岗,4200 万小微经营者可用,覆盖信贷、票据、财税等业务,被形容为看清「一个真正的人」。

𝕏 OpenRouter 数据:K3 模型每日生成 3000 亿 token

OpenRouter数据显示K3模型目前每天生成多达3000 亿token,尽管其使用量近月略有下滑。

𝕏 观点:DeepSeek 不热衷后训练算法设计,却超出 GPU 资源更丰富的公司

评论指出,DeepSeek从来不太热衷后训练算法设计,发明GRPO后仅做更新并加入 MOPD,但字节、阿里、谷歌、Meta 虽发表大量后训练算法研究,表现却不及 DeepSeek。


EVENT-DRIVEN INTELLIGENCE

免费先跟踪重点,再决定是否升级

每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。

分享

NEXT STEP · 留下邮箱

获取下一次重大事件提醒

每天一封精选情报,先用邮件建立复访,再决定是否升级到更深的追踪能力。