天眼晚报
🤖 AI 大模型
⭐ 微软发布 MAI-Transcribe-2-Streaming,实时语音转写准确率登顶
微软发布首款流式语音转文字模型MAI-Transcribe-2-Streaming,支持60 种语言,收到音频后约100 毫秒即输出首个假设文本。在 Artificial Analysis 流式榜单中以2.5% WER、0.13 秒延迟位列38 款模型第一,官方称出词速度比最接近竞品快 2 倍。
⭐ Gemini 4 Argon 发布:单次输出上限提至 100 万 Token
Google发布Gemini 4 Argon,单次输出上限从6.4 万 Token提升至100 万 Token,面向复杂软件工程与网络安全防御。定价为每百万输入 Token 2 美元、输出10 美元,首批仅向可信测试者开放。
🟩 开放权重模型正在缩小差距:Cloudflare、Black Forest、PewDiePie 三事件
10 月头两天发生三件事:Cloudflare发布270 亿参数决策模型Clef(Apache 2.0),在 10 项基准中 7 项超越品类创造者;Black Forest Labs发布FLUX 3 Image;PewDiePie透露因蒸馏 OpenAI 输出打造自己的9B本地模型Ajax而两次被封。
𝕏 Gemini 免费版 10 月 9 日起仅保留 Flash-Lite
谷歌宣布自10 月 9 日起,未订阅用户仅可使用Gemini Flash-Lite,Flash 和 Pro 不再对免费用户开放;付费 AI Pro/Ultra 可继续使用高阶模型,额度按模型与提示词复杂度每 5 小时刷新。
DeepSeek 扩招弹性计算团队,DSec 沙盒基础设施曝光
DeepSeek弹性计算团队扩招,其DSec安全体系自 2026 年初(V4-preview 时期)起建立,到 V4.1 时已拥有至少 5 个规模单元,号称"数百万并发沙箱"、每单元380K。DSec单个分片含160 台服务器、3 万CPU 核心、250TB内存,日均服务约300 万个沙盒,高峰期38 万个同时在线。
决策 AI 模型解析:TypeSafe Jev 与 Fastino GLiDE 等竞品对比
决策 AI 模型返回决策而非段落,输入带类型问题返回可分支的概率。TypeSafe AI推出Jev后 3 周内 Fastino Labs 发布 2 款竞品。Jev 支持Choice(最多 255 选项)、Score、Noul三种原语,所有问题并行评估,因不生成字符串故不会返回类型错误。
🔶 StartLux 开源决策模型登顶,36 局国际象棋赢 Jev 35 局
上海 AI 公司StartLux发布开源决策模型StartLux-Decision,在38 项基准中31 项超过Jev,综合得分63.88对57.91,推出 0.8B 至 27B 五档版本,国际象棋对弈 36 局赢 35 局。
匿名模型 Space-Bunny 登顶全球调用量,倍率仅 0.03x
匿名模型Space-Bunny上线十天登顶 OpenRouter 调用量榜首,周榜33.5 万亿token,倍率0.03x。分词器比对指向MiniMax家族,官方至今无人认领。
Meta Muse Spark 科学推理跑赢 Gemini,靠 16 个 Agent 并行
Meta旗下 MSL 发布Muse Spark模型,在 FrontierScience 科学推理基准得分38.3%,超过Gemini 3.1 Deep Think的 23.3%与 GPT 5.4 Pro 的 36.7%。其核心为同时调度16 个 Agent并行推理再整合,团队由前 Scale AI CEO Alexandr Wang 领导。
𝕏 ⭐ Pi 1.0 正式发布,同步推出实验性项目 Pi Durable
Pi 1.0 正式发布,从快速迭代产品转为稳定软件,原生支持MCP与非 LLM 模型,支持把多个模型组合成"虚拟模型"、延迟工具加载、Anthropic 模型缓存预热、会话中途系统消息。团队还推出实验性姊妹项目Pi Durable,押注常驻、跨界面的长期任务智能体。
OpenAI 发布 GPT-6 系列模型使用指南
OpenAI10 月 2 日发布GPT-6 系列使用指南:GPT-6 Astra用于最高智能推理,GPT-6.1 Sol用于复杂编程与研究,GPT-6 Luna用于大规模日常任务,并建议按工作负载选型。
𝕏 Seed Audio 1.0 影视级配音模型被严重低估
Seed Audio 1.0影视级配音模型情绪维度广、精度细,可匹配动态情绪。无需音色克隆,上传约15 秒MP3 参考音频即可复刻音色,可指定输出时长、语速及停顿,支持20 种语言,能演绎边吃饭边讲话等场景。
𝕏 Cloudflare 决策模型 Clef 上线 Ollama
Cloudflare决策模型Clef(27B)和Clef Flash(9B)已在Ollama上线,可用于图像分类、bug 报告标注、支持工单路由等任务。
𝕏 Claude Fable 5.5 内测作品合集整理发布
Anthropic尚未官宣的Fable 5.5内测作品被整理成库,含33 个视频作品提示词,整个库共1269 个Claude 5.5 作品并每日更新。
𝕏 LeCun 最新演讲:靠扩大 LLM 实现 AGI"不可能"
Yann LeCun在ETH Zürich演讲称,靠扩大 LLM 规模实现 AGI"不可能"。他指出 LLM 训练约30 万亿 token,而一个4 岁儿童仅靠视觉在 1 年 10 个月内就接收同等数据量,规模扩张只增加存储知识而非快速学习新任务的能力。
𝕏 OpenAI DevDay:ChatGPT 插件扩展支持应用内嵌入
OpenAI在 DevDay 介绍插件扩展,开发者可构建从ChatGPT侧边栏、侧面板、自定义文件查看器打开的插件,支持Sign in with ChatGPT简化登录。OpenAI 鼓励提供自定义 onboarding 技能引导用户完成设置。
Jev 估值 100 亿美元,创始人 Diogo Almeida 答一切
Jev估值达100 亿美元,创始人Diogo Almeida集中回应外界提问,量子位报道。
𝕏 蚂蚁 Ling-3.1-Flash 实测:1M 上下文生成信息卡一把通过
蚂蚁百灵新一代大模型Ling-3.1-Flash采用560B/A25B MoE 架构、1M token上下文。测试用 Teenage Engineering 风格信息卡提示词,模型理解分析文章、自行安排布局并多轮校验,一把通过,输出速度维持100+ tokens/s,全过程约 2-3 分钟。
🔶 OpenAI 安全系统负责人 David Robinson 离职,此前刚解雇三名安全研究人员
OpenAI安全系统团队负责人David Robinson已从公司离职,公司发言人称其上周离开。此前数日,OpenAI刚解雇三名安全研究人员,引发外界对安全团队稳定性的关注。
𝕏 Opus 5.5 本地 24 小时独立完成 MV,音视频创作能力引关注
开发者测试称Opus 5.5在 MacBook 上本地运行 24 小时完成一支音乐 MV:用 Blender+Python 做 3D 建模、Qwen-Image 2.1 生成图像、逆向 GarageBand 文件格式作曲。作者称该系列在创造力上"取得巨大突破"。
Claude Opus 5.5 疑似降智,评测分跌至 94.2%
BridgeMind称Claude Opus 5.5在NerfBench得分降至发布时的94.2%,同日GPT 6 Astra为98.0%、Sonnet 5.5 为 100.9%,暂判断属正常波动。
谷歌回顾 9 月 AI 发布:Gemini 4 Argon 与 Gemini 3.8 Live 等
谷歌回顾 9 月 AI 发布,涵盖Gemini 4 Argon前沿模型、Gemini 3.8 Live语音模型,以及为 Gemini Intelligence 设计的全新Googlebook笔记本品类。
Meta、OpenAI、Uber 同推主动式 Agent,难点在"何时开口"
Meta Muse、OpenAI Dots与Uber司机助理同期上线,共同把 Agent 从"被动问答"变为"主动推送"。文章指出,难题已从"答什么"转向何时打断、用哪个渠道、给什么建议,LLM 能写内容却难判断是否该发送。
𝕏 Tavus 预览 Griffin:能看、听、发声并像人一样外观的交互模型
研究实验室Tavus预览Griffin人机交互模型,能像人一样看、听、发声、外观,尚未公开发布。可用于能感知学生困惑的辅导、健康专家、语言教练等场景,团队正与合作伙伴制定披露与安全防护机制。
Gemini Live 在 Android 推出 Guided Vision,服务盲人及低视力用户
谷歌在兼容 Android 设备的Gemini Live中推出Guided Vision,通过摄像头为盲人和低视力用户提供对话式实时视觉辅助,包括环境描述和主动语音提示。
Altman 确认 OpenAI 与 Cerebras 深度合作,聚焦推理速度前沿
Sam Altman回应关于OpenAI与Cerebras合作的猜测,确认双方是紧密合作伙伴,正在速度前沿展开深入合作。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。