09月23日 · 科技晚报

天眼晚报

科技|2026年09月23日|237 分钟阅读
来源:963 条推文 + 1108 篇 RSS 文章·Lanyun·BatchV2 生成·2026-09-23
分享
AI 速读18 条精选

🤖 AI 大模型

OpenAI 发布 GPT-6 Sol 与 Luna:API 价格下调 50%,Luna 输入低至 0.1 美元

OpenAI正式发布GPT-6 SolGPT-6 Luna两款新模型并即刻上线 API。Sol 定位复杂编程与推理,输入/输出定价每百万 token 2 美元/10 美元,错误率降低一半、安全对齐增强;Luna 面向文档摘要、信息提取等高频任务,输入/输出仅 0.1 美元/0.5 美元,较 GPT-5.6 促销价下降约50%。两款模型沿用 GPT-6 Astra 训练方法,直接对标 DeepSeek 低价区间。ChatGPT Work 与 Codex 用户已可用,Free 与 Go 用户可通过桌面应用体验 Luna。

Anthropic 发布 Claude Opus 5.5:成本降 40%,Terminal-Bench 得分 66.4%

Anthropic发布Claude Opus 5.5,上线 API 与网页聊天,支持 100 万 token 上下文与 12.8 万 token 输出,输入/输出定价降至每百万 token 4 美元/20 美元,缓存读取便宜 60%,典型任务成本较 Opus 5 降低40%、输出提速超 30%。多数任务达到 Fable 5.1 水平,Terminal-Bench 4.0 得分 66.4%,高于 GPT-6 Astra 的 57.9%。模型经外部机构测试,提示词注入攻击成功率最低,并配备开源沙箱等安全防护。用户在 FrontierCode 基准的测试显示,med 与 max 思考程度得分接近,且高于 high 与 xhigh。

OpenAI 与 Anthropic 同日发新模型打价格战:最高降价 50%

9 月 22 日,OpenAI发布GPT-6 Sol/Luna,API 价格较 GPT-5.6 促销价降50%;Anthropic 发布 Claude Opus 5.5,运行成本较上代降 40%,输入输出 token 价格各降 20%。具体定价上,Anthropic 的 Opus 5.5 每百万输入 token 收费 4 美元、输出 20 美元;OpenAI 的 Sol 定价输入 2 美元、输出 10 美元,轻量版 Luna 低至输入 0.10 美元、输出 0.50 美元。两家美国顶级实验室竞争转向性价比,中国开源模型的市场挤压被视为降价主因。同日还有小米 MiMo v2.6、Grok 4.7、Step 5 preview 发布。

OpenAI 发布 GPT-6 Astra 旗舰模型,宣称“欢迎来到 AGI 时代”

OpenAI凌晨发布旗舰模型GPT-6 Astra,总裁Greg Brockman宣告“欢迎来到 AGI 时代”。该模型定位最复杂的推理与编码任务,与 Sol、Luna 共同组成 GPT-6 家族;其在 Terminal-Bench 4.0 上的 57.9%得分被 Claude Opus 5.5 的 66.4%超越。

🔶 曝 OpenAI 内部 AI 已可自主训练模型,官方紧急发布全球安全倡议

外媒 The Information 曝出,OpenAI内部模型已接管实验性 AI 训练的全流程,只需一个优化示例即可自主运行数周、多智能体协作迭代代码,原需数年的实验被压缩至一周OpenAI同期紧急发布全球安全倡议,单列RSI(递归自我改进)一节,呼吁各国 AI 安全研究所制定全球技术标准,并协调前沿模型能力提升之际的安全措施。

𝕏 阿里发布 Qwen-Audio-3.1 五款语音模型,ASR 降价 95%

阿里一次性发布Qwen-Audio-3.1系列五款语音模型并全线降价ASR 降 95%、Realtime 降 85%、TTS 降 70%,覆盖理解、生成与实时交互。系列升级 ASR、TTS 与 Realtime 三大模型,新增 TTS-Next 与 ASR-Next,Realtime 支持全双工打断与工具调用,实现从理解到创作的完整覆盖。

𝕏 阿里云向 Omarchy 捐赠 300 万美元并提供服务器赞助

阿里云宣布向Omarchy基金会捐赠300 万美元(分三年),并提供中国服务器和 CDN 赞助。Qwen Book将支持 Omarchy 系统,实现千问模型与用户依赖的中国服务全面集成。

𝕏 小米发布 MiMo-V2.6 系列并全面开源,登顶开源权重模型榜

小米发布MiMo-V2.6系列,含 Pro 与 Flash 两款全模态模型,全面开源模型权重与技术报告并推出桌面客户端。团队公开 MixRL 与 MOPD 两条训练管线、7K 个多样化环境及完整 RL 框架,两款模型在 6 天 Live RL 中各完成 30 步、累计约 75 万条轨迹。Vals Index显示 Pro 与 Flash 分列开源权重模型第一、第二位,支持 100 万 token 上下文与 128k 最大输出;在 Artificial Analysis 综合智能指数上超过 Qwen 3.8 Max、GLM5.3 Max,居国产模型首位。技术解析指其核心是用2.5 万条轨迹训练代码、视觉、安全共用一套 RL,并重新设计奖励机制。

𝕏 Anthropic 洽谈租赁最高 1GW 算力,绕开传统云厂商

据 The Information,Anthropic正与Apollo Global Management多数持股的数据中心开发商Stream洽谈,拟租赁最高1GW算力容量,计划部署与博通联合设计的 Google TPU,英伟达 GPU 也在讨论之列,以支撑模型训练。此举意在绕开传统云厂商,相关谈判仍处于初步阶段。

🔶 TypeSafe AI 发布 Jev:只做判断的 System One 模型,速度为大模型 193.6 倍

TypeSafe AI于 9 月 15 日发布Jev,定位为只做分类、评分和判断的System One模型,不生成文本,而是接收文本/JSON 状态并返回带概率的值,提供 Choice、Score、Noul 三种决策原语。官方称其速度是大模型的193.6 倍、成本约为其 1/444.6,输入定价 0.042 美元/百万 token、输出免费,延迟 70-500ms,适合分类、路由与评估。Vercel披露接入 AI Gateway 后 24 小时内近 13%付费团队使用,为 GPT-5.6 系列上线首日的 2 倍。

📄 H2LooP 发布 31B 电信专用模型,OT-Lite 榜单超越 GPT-5

H2LooP Telecom Model v1发布理解版与智能体版两个变体:理解版在OT-Lite基准 Pass@3 达81.8%,31B 参数在官方 Open Telco AI 榜单排名第 5,超过 Claude Opus 4.6、GPT-5、Gemini 3 Flash;智能体版电信代码生成 AST 相似度相对提升 8.8%、Location IoU 提升 20.0%,MMLU 保持 74.0%无灾难性遗忘。

🔶 SpaceXAI 发布 Grok 4.7,马斯克称智能体编程全球第三

SpaceXAI发布新主力模型Grok 4.7,较 4.6 整体提升而价格不变:输入每百万 token 2 美元、输出 6 美元,基座模型加大、强化学习训练拉长。马斯克称其将公司送上智能体编程第三位,仅次于Anthropic和 OpenAI,并透露 Grok 4.8 已训练完成。Cursor、Grok Build 和 Grok API 已可调用。

📄 7500 组对话审计六家模型的政治应答策略

预注册实验以7500 组多轮对话测试6 家模型:GPT 迎合所有用户,Gemma 一律拒答,Claude 仅对强保守用户作答35%,Grok 只迎合保守派。

𝕏 vLLM 发布 v0.30.0,新增 HiSparse 分层缓存

vLLM v0.30.0发布,包含762 次提交315 名贡献者(含 104 位首次贡献者)。新增 HiSparse 主机层缓存、Model Runner V2 流水线并行、双密钥 Gumbel-max 水印,支持 GLM-5.3-Flash、K2-Horizon 等新模型。

Claude Code v2.1.280 将 Opus 5.5 设为默认模型

Anthropic推送Claude Code v2.1.280Claude Opus 5.5成为默认 Opus 模型,支持 100 万 token 上下文、输入 4 美元/百万 token;Pro 与 Team Standard 套餐默认模型由 Sonnet 换为 Opus。

OpenAI 将第三方安全评估引入模型训练与开发全流程

OpenAI宣布计划在模型训练、评估和部署早期阶段引入第三方机构开展技术安全评估,不再限于发布前审查,并提出独立机制、科学严谨性、稳健安全实践、明确责任划分四项优先事项。公司正与METR、Redwood Research 等机构洽谈合作。

📄 语义-几何解耦路由实现免训练块稀疏注意力,128K 提速 5 倍

语义-几何解耦路由把语义聚合移到 RoPE 之前并用结构先验重建几何偏置,4K-128K 接近全注意力精度,128K时较 FlashAttn 加速5.03 倍,路由开销低于 3.4 毫秒。

𝕏 阿里 Qwen-Image-2.1 登顶开源文生图与图像编辑双榜

阿里 Qwen发布Qwen-Image-2.1在 Image Edit 与 Text-to-Image Arena 双榜位列开源第一,图像编辑榜以1367 分领先第二名 Hunyuan Image 3.0 Instruct 达 65 分。该7B 参数模型原生支持 2K 分辨率生成、图中文字渲染、透明图输出及最多 10 张参考图编辑,生成效果可媲美闭源 GPT Image2.5,原生可在 ComfyUI 中使用,并已出现越狱版本。阿里云栖大会同时宣布继续加大开源投入。

Redis 之父泼冷水:绝大多数开发者不需要 Jev

Redis作者antirez公开质疑Jev热潮,称其仅有狭窄应用场景,围绕它的炒作暴露了 AI 泡沫中多数人“分不清什么重要”。该推文获超11.6 万次浏览,引发 Jev 支持者与质疑者的新一轮争论。

🔶 AI 计费模式切换引企业不满,微软以约 30%折扣挽留客户

微软将企业买家购买超1000 个 Copilot 席位的折扣提至约30%亚马逊、Figma、Workday等同步推出 AI 产品新折扣。客户因按使用量计费的模式变动而疲惫,采购 AI 工具更谨慎。

🔶 科大讯飞发布语音识别大模型 Spark-ASR-2.0

科大讯飞发布Spark-ASR-2.0,中英文混合识别与动态上下文注入提升整体效果,推理成本仅增10%,9 月 24 日起上线讯飞输入法并开放 API。

📄 Fathom-Vaidya:30B 医疗模型在 HealthBench-Hard 超过 GPT-5

Fathom-Vaidya先用规则与评分量表强化学习提升诊断推理,再用5.3k条合成多轮临床场景配多维评分量表训练临床推理;30B模型在HealthBench-Hard达 50.1%,MedXpertQA 提升超 10%,超过 GPT-5(thinking)等闭源基线。

𝕏 ValsAI:Claude Opus 5.5 单价降 20%,但 token 用量增加抵消折扣

ValsAI指出,Anthropic将 Opus 5.5 输入/输出价格从每百万 token 5/25 美元降至4/20 美元但 Opus 5.5 在编码基准中消耗更多 token,实际折扣被用量增长抵消

📄 全流程 FP8 强化学习训练 LLM,Calibrated Clipping 消除熵激增

研究者提出Calibrated Clipping通过匹配 BF16 分布校准 FP8 裁剪边界,消除全流程FP8 强化学习中的熵激增与乱码,8B-32B 模型恢复至 BF16 水平。

📄 8B 双向步级推理评估器 LLaDA-PRM,超越 34B 基线

LLaDA-PRM是 8B 双向步级推理评估器,在 MR-MATH-invalid 达88.8 F1比 34B 的 ReasonEval 高11.3 分,还可用于训练数据筛选。

DeepSeek、Anthropic 等中美 AI 公司本周向联合国安理会通报 AI 风险

据路透社,中国 AI 公司DeepSeek预计本周向联合国安理会就 AI 潜在风险与安全挑战进行专题通报,月之暗面等中国企业也在走向国际治理舞台。同时,Anthropic CEO达里奥·阿莫代周三将就 AI 发展及潜在风险作远程简报,OpenAI 的奥特曼、Hugging Face CEO 德朗格、联合国 AI 小组联合主席本吉奥等也将参会。

Meta 承认 AI 代理 Muse 设计深受 OpenClaw 影响

Meta 超级智能实验室产品负责人Nat Friedman回应质疑,承认 AI 代理Muse在设计上深受OpenClaw影响,其SOUL.md配置文件内容与后者几乎完全相同。Muse 近期登顶美国 App Store 排行榜。

𝕏 xAI 的 Grok Bot 上线首月用户破 40 万,为 SpaceXAI 省下约 200 个客服岗

xAIGrok Bot代理上线约一个月,截至 9 月 14 日周活跃用户达41.8 万,环比增长 24%,首月用户数突破 40 万。SpaceXAI称该客服代理支持量增长 175%而零新增人力,或为其节省约 200 个客服招聘岗位,单次解决成本仅0.20–0.30 美元

扎克伯格谈 Muse:上线 12 天下载破 280 万,Agent 想象空间在互相交流

Meta个人 AI Agent Muse上线 12 天下载量突破280 万,日活约 64 万,一度登顶美国 iOS 免费榜。扎克伯格称 Agent 真正的想象空间在于彼此交流和协作。

📄 MolSC 数据集与基准:评测 LLM 的取代基效应预测能力

MolSC18.1 万取代基贡献训练样本与1541 题基准,实验显示 GPT-5.2、Gemini-3-Flash 等预测取代基效应可靠性有限,微调后显著提升。

📄 偏好优化给模型装上“按来源可靠性决定是否改答案”开关

Qwen2.5-7BLlama-3.1-8B上,覆盖可靠性标注的偏好优化可安装决策开关,准确率达0.84且泛化到新表述,监督模仿则做不到(0.50)。

🔶 Meta 为 AI 智能体 Muse 测试“人工礼宾”电话代办服务

Meta正为个人 AI 智能体Muse测试“人工礼宾”服务,由外包人员悄悄处理部分通过该应用拨出的电话。该功能上周已向约半数员工开放,部分员工担忧敏感信息泄露。

📄 ParA-LLM 补齐副语言与声学理解,超 GPT-4o-Audio

ParA-LLM基于120 万语音问答对训练,ParA-Bench上比 GPT-4o-Audio 高 7.5%,而后者在 6000 道题上准确率仅 36%。

📄 东南亚语音推理基准 SEABED:最强模型仅 50.3%

新基准SEABED5404 组东南亚语音推理问答,最强模型Gemini 3.5 Flash加权准确率仅 50.3%,并考察推理是否有音频依据。

📄 不变性加权蒸馏提升学生模型 OOD 鲁棒性

不变性加权蒸馏(IWD)按教师模型的因果依赖重加权样本,在 16 项 OOD 评测中 15 项最优,NLI 平均提升4.34、QA 提升14.94个百分点。

📄 用 7 种心理量表给 9 个大模型做跨语言人格画像

研究用7 种心理量表、中英双语对9 个大模型各重复测试 5 次,发现模型具有可复现、可识别身份的行为特征,未答题项呈结构化分布。

🔶 马斯克:中国 AI 大模型单位算力产出性能几乎全球顶尖

马斯克接受央视财经专访称,中国 AI 大模型“整体非常出色”,单位算力产出性能几乎全球顶尖,估测两到三年内可补齐算力缺口。

🔶 荣耀与阿里共建五大垂域模型,Magic9 首发系统级 Agent

荣耀产品线总裁方飞在云栖大会宣布,阿里共建五大垂域模型与解决方案,即将发布的荣耀 Magic9将搭载行业首个系统级Agent Harness操作系统,让 Agent 从“能理解”走向“能稳定执行”。

🔶 OpenAI 与 Grab 合作,两年内培训 3 万名东南亚从业者

OpenAI与东南亚出行外卖平台Grab合作启动 AI 技能培训项目,覆盖新加坡、泰国、印尼、菲律宾,计划两年内培训约3 万名司机、商户与骑手,学员可获三个月 ChatGPT Plus 免费使用权。

𝕏 实测对比:GPT-6 Luna 与 DeepSeek-V4.1-Flash 谁更便宜

成本场景对比显示:短上下文、缓存未命中或以输出为主的负载,GPT-6-Luna便宜1.2–2.6 倍;输入超272K或缓存命中为主的 Agent 负载,DeepSeek-V4.1-Flash反超或持平。

🔶 消息称豆包通用 Session 团队减员约一半

豆包通用Session 团队据报将缩减约一半,由负责人赵祺推动,原约 50 人,部分人员转岗至豆包商业化、飞书团队,其余裁撤;对话方向后训练团队同步缩减。

𝕏 DiffusionGemma-Jev 现已支持 vLLM

DiffusionGemma-Jev现已可在vLLM上运行:支持是/否、多选或打分问题,并在单次去噪步骤中从每个答案槽读取概率分布。

📄 按查询门控 LLM 重排器,跳过 51%调用仅损 1.2 个百分点

学习式按查询门控只用调用前的检索特征,可跳过**51%**的 LLM 重排调用,多跳检索 LastHop@K 平均仅损失1.2 个百分点


EVENT-DRIVEN INTELLIGENCE

免费先跟踪重点,再决定是否升级

每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。

分享

NEXT STEP · 留下邮箱

获取下一次重大事件提醒

每天一封精选情报,先用邮件建立复访,再决定是否升级到更深的追踪能力。