天眼早报
🤖 AI 大模型
𝕏 【重磅】Grok 4.6 正式发布,登顶 AI 智能指数
SpaceXAI正式发布Grok 4.6,在 NVIDIA GB300 NVL72 上训练运行,Artificial Analysis 智能指数得分61,追平 GPT-5.6 Sol、逼近 Fable 5(62);Agentic ELO 达 1753,GDPVal-AA 反超 Fable 5 Max。模型运行速度 80 TPS,支持 50 万 token 上下文,专为长周期 Agent 任务设计。定价维持**$2/$6**每百万 token,较 Fable 5 便宜 80%、较 Opus 5 便宜 60%;7 天内用户可享双倍 token。现已上线 Grok Build、Cursor、API、OpenRouter、Notion 与 Poe。
𝕏 【重磅】DeepSeek V4 Pro 正式版发布,API 性能逼近 Fable 5
DeepSeek正式发布V4 Pro模型(版本标识:DeepSeek-V4-Pro-0813),API 已开放调用,OpenRouter 与 OpenCode 同步上线。总参数 1.5T/1.6T、激活 490B,支持 100 万上下文。基准测试显示,其在 Terminal Bench、Cybergym 等 Agent 能力榜单上超越 Opus 4.8 与 NVIDIA Nemotron3 Ultra,性能紧追Fable 5;Agent 基准大幅提升:DeepSWE 62.7、Terminal Bench 87.9、CyberGym 83.3。定价输出仅6 元/百万 tokens(约 $0.87),缓存命中输入 0.025 元,成本较 Opus 4.8 降低约 57 倍。SemiAnalysis 指出 NVIDIA 委员会式开发模式失败,DeepSeek 高效激活架构优势明显。
𝕏 ⭐阿里开源 Qwen3.8-Max:2.4T 参数、95B 激活,可自主编程 10 天
阿里开源Qwen3.8-Max:总参数2.4T、激活95B、512 专家、支持 1M 上下文,为迄今最大开源权重之一。在多模态 Agent 任务中表现惊人——连续自主编码超 10 天搭建自进化框架,并自主运行 125 小时复现论文;芯片设计任务将 die 面积缩小 81%。vLLM 首日支持 NVIDIA/AMD,提供现成 4-bit 检查点。
𝕏 微信正式发布自研大模型 WeLM 80B 和 617B 两个版本
微信正式发布自研大模型WeLM系列:WeLM-80B(总参数 800 亿,激活 30 亿)和WeLM-617B(总参数 6170 亿,激活 230 亿)。80B 版本已部署至微信原生 AI 助手小微,支持调用微信功能和小程序。
𝕏 ⭐ Upstage 发布 Solar Pro 4 推理模型,智能指数从 14 跃升至 42
Upstage发布Solar Pro 4旗舰推理模型,AA 智能指数从14跃升至 42;Terminal-Bench 从 12%到 57%,GDPval-AA 从 498 到 1276;定价**$0.30/$1.20**每百万 token。
𝕏 微软发布首个自研推理模型 MAI-Thinking-1
微软CEO 纳德拉宣布,MAI-Thinking-1作为从零打造的首个推理模型,已在Microsoft Foundry上线。
𝕏 Unsloth 实现 Qwen3.8 动态 1-bit 量化,模型缩小 91% 可本地运行
Unsloth通过动态 1-bit 量化将Qwen3.8-2.4T-A95B从 4.9TB 压缩至 397GB(缩小 91%),可在 410GB 以上内存运行,性能媲美 GPT-5.6 Sol。已提供 GGUF 格式。
𝕏 Llama Index 发布 ExtractBench 白皮书,构建文档提取新基准
Llama Index发布 36 页 ArXiv 论文,推出ExtractBench基准测试。该基准覆盖 14+提取系统,包含真实企业文档与合成数据,旨在评估 Schema 引导的文档提取准确性、成本及落地能力,填补行业评测空白。
𝕏 首个通用手语转文本模型发布,Android 新增 ASL 输入
redpony 团队发布首个通用手语转文本(SL2T)模型,并为Android手机带来ASL手语输入功能,未来将支持更多手语。
𝕏 Meta 开源 Muse Glimmer,首款本地智能体视觉模型
Meta开源Muse Glimmer,30B 视觉模型,支持 131K 上下文,2-bit 量化仅需 12GB 内存。
𝕏 四款开源 AI 视频模型齐发,打通视频生产全链路
四款开源 AI 视频模型齐发:IndexTTS-2.5、LTX-2.5、Wan-Animate-2、NAVA开源,覆盖配音、角色驱动、多镜头剪辑与音画同步。
𝕏 DeepSeek 推理缓存命中率达 96.56%,效率远超同行
开发者反馈DeepSeek推理缓存命中率高达96.56%,第二好的提供商仅为 91.60%。这使其 GPU 使用时间减少约2 倍,推理成本大幅降低。
𝕏 Soniox 发布 TTS v2 语音模型,价格低至每小时 0.7 美元
Soniox发布TTS v2,支持 60+语言,收费0.70 美元/小时,较 ElevenLabs 便宜 7 倍。支持音频标签控制情感语气、毫秒级时间戳与跨语言克隆,面向实时语音代理。
𝕏 语音代理技术栈简化:多模态 LLM 直接理解语音,无需 STT
语音代理技术栈从VAD→STT→LLM→TTS简化为VAD→MLLM→TTS,多模态 LLM 可直接理解音频。开发者可构建更好的语音代理。
𝕏 Claude Opus 5 响应长度激增 3 倍,词汇反而更简单
LMArena分析Claude Opus 4.5 至 5的输出发现:Opus 5 平均响应510 词,是 4.5 的 3 倍;句子长度增 58%,但抽象名词减少 53%。Fable 5更简洁,平均 316 词,且更频繁加入肯定性表述。
𝕏 xAI 发布 Grok Voice Think Fast 2.0 语音模型
SpaceXAI推出新一代语音模型Grok Voice Think Fast 2.0,提升智能、转写准确率和对话能力。
𝕏 vLLM 联合英伟达推 KV 缓存卸载,模型加载加速 7.3 倍
vLLM新增KV connector,通过 LM Cache 将 KV 缓存存至 Azure Blob;与 NVIDIA Dynamo 合作的 ModelExpress 模型加载方案,在 H100/A100 上比默认加载快7.3 倍。
𝕏 OpenAI 将 ChatGPT 广告扩展至五个新国家
OpenAI于 8 月 11 日将ChatGPT Ads正式扩展至英国、日本、韩国、巴西和墨西哥,AI 搜索商业化明显提速。
𝕏 Cohere 开源 North Micro Vision 小模型,专注文档理解
Cohere发布North Micro Vision,目前最小的视觉语言模型,擅长文档理解,Apache 2.0开源,权重已上 HuggingFace。
𝕏 DeepSeek V4 Pro 0813 长程任务现早停问题,测试不及 GLM-5.1
开发者测试显示,DeepSeek V4 Pro 0813长程任务现早停问题:在 max 模式 50 轮任务中 2 次提前早停,未超过GLM-5.1。
𝕏 MiniMax H3 开源后字节系模型开始降价
MiniMax H3开源后,字节跳动感受到了竞争压力,旗下模型开始降价。这是 AI 开源模型冲击闭源价格体系的最新信号。
𝕏 DHH 用 Claude 分析发现 Spotify 桌面端 1.25GB 内存占用多半来自 Chromium
Claude分析Spotify桌面端:1.25GB常驻内存中720MB为 Chromium 开销。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。