10月02日 · 科技早报

天眼早报

科技|2026年10月02日|约 136 分钟阅读
来源:992 条推文 + 466 篇 RSS 文章·Lanyun·BatchV2 生成·2026-10-01 — 2026-10-02
分享
AI 速读20 条精选

🤖 AI 大模型

𝕏 OpenAI 完成 1220 亿美元融资,NVIDIA 与 SoftBank 全额注资

OpenAI 宣布完成 1220 亿美元融资轮次,NVIDIA 与 SoftBank 各支付最终 100 亿美元,Amazon 此前已注入 500 亿美元。至此,三大锚定投资者共交付 1100 亿美元,标志着 AI 基础设施投资与资本化进入新阶段。

微软发布三款语音 AI 模型,实时转录以 2.5% WER 登顶

微软 推出 MAI-Transcribe-2-Streaming 等三款新语音模型,在 Artificial Analysis 基准测试中以 2.5% 的词错误率(WER)和 0.13 秒延迟位居第一,支持 60 种语言流式识别。流式定价 0.54 美元/小时(9.00 美元/千分钟),非流式 0.10 美元/小时。

Cohere 发布 Embed 5:支持图文融合,Pro 与 Fast 共享嵌入空间

Cohere 推出 Embed 5 模型家族,包含 Embed 5 Pro 和 Embed 5 Fast 两个层级,均支持文本、图像及图文融合输入。两者共享同一嵌入空间,允许用不同层级分别做索引和查询,默认输出维度为 2048。

OpenAI 推出 Codex 云端环境,支持代理持续运行与工作区复用

OpenAI 发布 Codex 云端环境功能,允许开发者创建可复用的工作区,预置仓库、依赖与脚本。该功能使 AI 代理在会话结束后仍能持续运行,显著降低启动延迟并提升开发效率。

🟩 Cloudflare 开源 Clef 决策模型:27B 旗舰 + 9B Flash,对标 Jev API

Cloudflare Workers AI 团队发布首批自研决策模型 Clef 与 Clef-flash,基于 Qwen 骨干构建,包含 27B 旗舰版和 9B Flash 版,支持 256k 上下文(托管 64k)与图像分类,clef-flash 比基准快约 13 倍,以 Apache 2.0 开源权重并托管在边缘 GPU 上。该模型旨在替代 TypeSafe 的 Jev API,用于代理路由与动作选择,已在 Hugging Face 和 Cloudflare Workers AI 上线。

谷歌发布 Gemini 4 Argon 旗舰模型:100 万 token 输出、价格仅 Astra 一半

Google 发布旗舰模型 Gemini 4 Argon,采用 RSI 技术加持,面向软件工程、企业知识工作与网络安全,单次输出上限由 6.4 万提升至 100 万 token,API 推广价 $2/$10。多方报道称其价格仅为 OpenAI Astra 的一半,已向付费订阅用户及一小批可信网络安全合作伙伴逐步开放,并在 Vals Index 以 68.9% 首次登顶。内部案例含 C/C++ 代码库迁移 Rust、释放超 300TiB 内存;但彭博社称内部人士质疑其在编程等关键领域的实战表现。

𝕏 DeepSeek 开源华为昇腾适配项目,矩阵内核达峰值 99.8%

DeepSeek 开源六个华为昇腾项目,核心 TileLang 让同一源码可编译至昇腾而非英伟达芯片,DeepGEMM-Ascend 矩阵乘达 431 BF16 TFLOPS(芯片上限 432,即峰值 99.8%),梁文锋称华为本季度或交付训练芯片。

Claude 新增对话内生成幻灯片、文档与设计功能,限时 50% 用量减免

Anthropic 的 Claude 现已支持直接在对话中生成幻灯片、文档和设计稿。从即日起至 10 月 15 日,基于设计/文档任务生成的后续内容可享受 50% 用量折扣,涵盖 Pro、Max 和 Team 计划。

𝕏 Black Forest Labs 发布 FLUX 3 Image,支持多参考图与 4K 输出

Black Forest Labs 发布 FLUX 3 Image,支持文本生图与多参考图编辑,原生 2K/4K 输出,最多可用 10 张参考图合成,并支持用边界框精确布局。商业权重先行开放,开源权重将在数周内发布。

Anthropic 瞄准感恩节前完成大规模 IPO

Anthropic 计划于 11 月中旬启动 IPO 路演,预计估值区间为 1.8 万亿至 2 万亿美元,募资规模有望匹敌或超越 SpaceX,目标是在感恩节前完成这轮大规模上市。

💻 AWS 推出 Strands Decider 2B 决策模型,附带训练数据与脚本

AWS 旗下 Strands Labs 发布 Strands Decider 2B,这是亚马逊推出的首个类 Jev 决策模型,并附带训练数据与脚本,用于自然语言路由、工具选择与输出校验。随着 Cloudflare 等公司纷纷入局,Web 端决策模型市场正迅速扩张,旨在解决代理自动化中的路由与决策问题。

GLM 5.3 Flash 额度提升至 60 美元,提供 100 万上下文窗口

Command Code 将其 GOAT 计划中的 GLM 5.3 Flash 使用额度提升至 60 美元,支持 100 万 token 上下文窗口及多模态能力,为开发者提供更充裕的模型调用资源。

▶️ OpenAI 推出 Dots 个人助手,挑战 Meta Muse

在 DevDay 大会上,OpenAI 发布名为 Dots 的 AI 代理,由 GPT-6 Astra 驱动。Dots 以彩色 Blob 形象呈现,不仅能作为助手,还能构建虚拟世界,直接对标 Meta 的 Muse 平台,试图在个性化 Agent 领域争夺市场份额。

𝕏 微软 MAI-Voice-2.1 上线,单音色支持 23 种语言

微软 AI 的 MAI-Voice-2.1 上线 OpenRouter,单音色支持 23 种语言且保持母语口音,定价 22 美元/百万字符;Flash 版可在 150ms 内生成 45 秒音频。

🤗 Allen AI 发布 Olmo-core 3,面向万亿参数 MoE 训练

Allen AI 发布 Olmo-core 3,一套面向大型 MoE 模型的开源可扩展训练基础设施,可扩展至万亿参数级别,用于支撑下一代 Olmo 模型的训练。

𝕏 Prime Intellect:Qwen3.6 经约 100 步 GRPO 训练奖励提升 2.8 倍

Prime Intellect 用托管训练对 Qwen3.6 做约 100 步 GRPO,held-out 奖励从 0.127 升至 0.361(2.8 倍);Qwen3.5 用同样方法达到 0.356,仅激活 3B 参数即逼近 Claude Opus 4.8,显示小模型经强化学习微调后可获得显著能力提升。

OpenAI 指控月之暗面协同提取其模型推理过程

OpenAI 称已阻止一场协同提取推理过程的行动,核心群体与中国初创公司 月之暗面 相关。行动始于 7 月初,4000 多名用户提出 1.6 万次请求,于 7 月 28 日被完全阻断。

哈佛物理学家提出 AI 与科学存在「阻抗失配」,构建精确计算工具包

哈佛物理学家马修·施瓦茨指出当前 LLM 作为科学协作者的局限性,提出「阻抗失配」概念。他构建了一套精确计算工具包,帮助 Claude 发现跨越数十个学科的科学联系,推动 AI 科研范式转变。

🟩 Claude Opus 5.5 与 GPT-6.1 Sol 对比:如何自测选型

Claude Opus 5.5(9 月 22 日发布,$4/$20)与 GPT-6.1 Sol(9 月 29 日 DevDay 发布,$2/$10)的选型对比:高并发、成本敏感场景适合选 Sol,长程代理编程任务则更适合 Opus。两者上下文窗口均约 100 万 token。文章还给出在自己提示词上自测的方法论,帮助开发者用真实任务而非榜单分数决定调用哪个模型。

𝕏 阿里 Qwen-Image-2.1 登顶开源图像模型榜首

阿里 发布 Qwen-Image-2.1,7B 参数,单模型支持文生图与图像编辑,原生 2K 输出及透明背景,在 AA-Image 榜单从第 72 位升至第 18 位,领先所有开源权重模型。

𝕏 Liquid AI 决策模型 D1 上线 OpenRouter

Liquid AI 的决策模型 D1 上线 OpenRouter,输入 0.04 美元/百万 token、输出免费,提供 65K 上下文,返回带概率的类型化答案。

𝕏 Claude Opus 5.5 以 167 分登顶 Epoch 能力指数

Claude Opus 5.5 以 167 分登顶 Epoch Capabilities Index(ECI),微弱领先 GPT-6 Astra;Claude Sonnet 5.5 约 165 分,与 Claude Fable 5.1 持平。

𝕏 LlamaIndex 发布 Extract v2.5 文档提取智能体

LlamaIndex 发布 Extract v2.5,文档提取智能体在长列表(86.1%→95.5%)、跨页记录(85.5%→96.5%)、扫描表单(90.9%→95.7%)三类任务上大幅提升,性能超越 Opus 5.5 和 GPT-6 Sol,成本低 30%–4 倍。

𝕏 OpenRouter 上线 Pareto 26.10 预览版,降价至 $0.8/$3.2

OpenRouter 上线 Pareto 26.10 预览版,输入 $0.8/百万 token、输出 $3.2/百万 token,较现行版本的 $2.5/$7.5 大幅降价。该模型支持 100 万上下文、图文输入与工具调用。

𝕏 Tavus 发布 Griffin,首个通过视频图灵测试的人机交互模型

Tavus 发布 Griffin,48% 与之实时对话的人误以为对方是真人,此前系统的通过率不足 3%。该模型在 NVIDIA 全双工 AI 视频基准排名第一,是首个人机交互模型(HIM)。

𝕏 Grok 4.7 上线谷歌 Gemini 企业智能体平台

Grok 4.7 上线 Gemini Enterprise Agent Platform,企业用户可在谷歌智能体平台直接调用该模型,进一步扩展企业侧的模型选择。

𝕏 GLM 5.3 系列上线 Cursor

GLM 5.3 与 GLM 5.3 Flash 已在 Cursor 上线,官方称 GLM 5.3 Max 是 CursorBench 4.0 得分最高的开源权重模型。

𝕏 JEV-27B-VL 开源多模态模型发布,支持快慢双思考模式

开源多模态模型 JEV-27B-VL 支持两种思考模式:直觉反应在毫秒到数百毫秒内给出选项概率,深度分析则逐步推理并输出文本解释。模型支持图片输入,可用于视频推荐、玩游戏等场景。

用户展示 Opus 5.5 生成能力:榫卯科普视频与赛车游戏设计文档

多位用户晒出 Opus 5.5 的生成成果:有人用它制作榫卯科普介绍视频,称成片质量非常好,体现其在科普与人文类内容上的表达能力;也有作者用其生成《头文字 D》同人赛车游戏《秋名山车神》的完整设计文档,基于 Three.js,涵盖角色、车型、剧情与建模规格,并要求 AI 自行通关、录制、剪辑成视频。

Anthropic Claude for Government 正式商用

Anthropic 宣布面向美国联邦和州政府机构打造的 Claude for Government 结束公测正式商用,运行于获得 FedRAMP High 授权的环境中,提供代码开发、智能代理和办公自动化能力。

𝕏 匿名模型 Space Bunny 走红:编码强、速度快、价格低

开发者社区热议匿名编码模型 Space Bunny,称其编码能力出色、速度极快且价格低廉,但创建者身份完全成谜,真伪与实际来源仍待验证。目前讨论多基于个人使用体验,尚无官方文档或权威基准佐证。


EVENT-DRIVEN INTELLIGENCE

免费先跟踪重点,再决定是否升级

每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。

分享

NEXT STEP · 留下邮箱

获取下一次重大事件提醒

每天一封精选情报,先用邮件建立复访,再决定是否升级到更深的追踪能力。