天眼晚报
🤖 AI 大模型
月之暗面开源发布 Kimi K3,2.8T 参数全面超越闭源模型
月之暗面发布并开源Kimi K3模型,参数规模达2.8 万亿,上下文长度100 万 token,API 价格仅为Fable 5的三分之一。综合基准超越Gemini、Opus 4.8,编码能力媲美Fable 5,成本仅 1/5。在SpreadsheetBench 2评测中排名第一,超越所有闭源模型。10 天后开放权重。
𝕏 Kimi K3 多维度评测:前端能力突出,性价比超 Fable 5
开发者vista8发布Kimi K3详细评测报告,涉及 6 个真实场景项目,K3 在交互、界面、视觉、空间场景可为首选,但架构、后端场景仍落后于Claude Fable 5和GPT-5.6 Sol。用户利用Kimi K3的前端能力生成中肠袢旋转动画,效果接近专业医学动画。Together Compute使用DeepSWE基准测试对比,结果显示Kimi K3在同等性能下价格仅为Fable 5的35%,且在更高 pass@k 时表现更优。
𝕏 Grok 4.5:代码能力登顶 FrontierCode,性价比为 Fable 5 的 1/9
Grok 4.5被Cognition新基准FrontierCode收录,该榜单评测真实可合并的生产级代码。马斯克表示 Grok Build 几乎每天都在改进。根据Artificial Analysis数据,Grok 4.5每 Intelligence Index 任务仅0.31 美元,约为Claude Fable 5的 1/9、Claude Opus 4.8的 1/6、GPT-5.6 Sol的 1/3,且 token 消耗少 6 倍。
𝕏 马斯克宣布 Grok 4.6 下周完成初始训练,2T 参数
马斯克在 X 平台宣布,xAI的 2T 参数模型Grok 4.6将于下周完成初始训练,全面优于 1.5T 的Grok 4.5,可能在速度和 token 效率接近的情况下超越Kimi K3。但实际可用仍需 1-2 个月,需谨慎看待马斯克的夸大宣传。
🔶 Anthropic 宣布 Claude Fable 5 订阅政策调整:Pro 用户不再免费,Max 用户按 50%额度访问
Anthropic宣布自7 月 20 日起,Claude Fable 5永久包含在Max和Team Premium订阅中,使用额度限制为 50%。Pro和Team Standard用户将无法免费使用,但获一次性100 美元额度补偿(按量计费)。此举因Kimi K3竞争压力,受限于算力。
𝕏 AI 建议让用户不愿说“不知道”,研究揭示认知风险
arXiv研究显示,AI 建议使人们放弃判断的比例从 44%降至 3%,正确率从 27%降至 9%。5 个实验、3132 人参与,即使 AI 给出错误建议,用户仍更自信。
𝕏 Grok TTS 在 Humanness Index 登顶,成本仅为 Eleven v3 的 15%
Grok TTS在 Humanness Index 上获得94 分(人类基线 100),排名第一。延迟仅为 460ms,成本15 美元,远低于Eleven v3的 100 美元,性价比突出。
上海发布首个疑难病例 AI 诊疗评测基准
2026 世界人工智能大会医学分论坛上,上海发布业界首个针对疑难病例的AI 诊疗评测基准,覆盖 30 个临床专科。同时更新医疗 AI 评测体系至 5.0,新增“原子技能”评测方式。上海市卫生健康行业算力服务中心揭牌。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。