07月18日 · 科技晚报

天眼晚报

科技|2026年07月18日|47 分钟阅读
来源:702 条推文 + 59 篇 RSS 文章·Lanyun·DeepSeek 生成·2026-07-18
分享
AI 速读18 条精选

🤖 AI 大模型

月之暗面开源发布 Kimi K3,2.8T 参数全面超越闭源模型

月之暗面发布并开源Kimi K3模型,参数规模达2.8 万亿,上下文长度100 万 token,API 价格仅为Fable 5的三分之一。综合基准超越GeminiOpus 4.8,编码能力媲美Fable 5,成本仅 1/5。在SpreadsheetBench 2评测中排名第一,超越所有闭源模型。10 天后开放权重。

𝕏 Kimi K3 多维度评测:前端能力突出,性价比超 Fable 5

开发者vista8发布Kimi K3详细评测报告,涉及 6 个真实场景项目,K3 在交互、界面、视觉、空间场景可为首选,但架构、后端场景仍落后于Claude Fable 5GPT-5.6 Sol。用户利用Kimi K3的前端能力生成中肠袢旋转动画,效果接近专业医学动画。Together Compute使用DeepSWE基准测试对比,结果显示Kimi K3在同等性能下价格仅为Fable 535%,且在更高 pass@k 时表现更优。

𝕏 Grok 4.5:代码能力登顶 FrontierCode,性价比为 Fable 5 的 1/9

Grok 4.5Cognition新基准FrontierCode收录,该榜单评测真实可合并的生产级代码。马斯克表示 Grok Build 几乎每天都在改进。根据Artificial Analysis数据,Grok 4.5每 Intelligence Index 任务仅0.31 美元,约为Claude Fable 5的 1/9、Claude Opus 4.8的 1/6、GPT-5.6 Sol的 1/3,且 token 消耗少 6 倍。

𝕏 马斯克宣布 Grok 4.6 下周完成初始训练,2T 参数

马斯克在 X 平台宣布,xAI的 2T 参数模型Grok 4.6将于下周完成初始训练,全面优于 1.5T 的Grok 4.5,可能在速度和 token 效率接近的情况下超越Kimi K3。但实际可用仍需 1-2 个月,需谨慎看待马斯克的夸大宣传。

🔶 Anthropic 宣布 Claude Fable 5 订阅政策调整:Pro 用户不再免费,Max 用户按 50%额度访问

Anthropic宣布自7 月 20 日Claude Fable 5永久包含在MaxTeam Premium订阅中,使用额度限制为 50%。ProTeam Standard用户将无法免费使用,但获一次性100 美元额度补偿(按量计费)。此举因Kimi K3竞争压力,受限于算力。

𝕏 AI 建议让用户不愿说“不知道”,研究揭示认知风险

arXiv研究显示,AI 建议使人们放弃判断的比例从 44%降至 3%,正确率从 27%降至 9%。5 个实验3132 人参与,即使 AI 给出错误建议,用户仍更自信。

𝕏 Grok TTS 在 Humanness Index 登顶,成本仅为 Eleven v3 的 15%

Grok TTS在 Humanness Index 上获得94 分(人类基线 100),排名第一。延迟仅为 460ms,成本15 美元,远低于Eleven v3的 100 美元,性价比突出。

上海发布首个疑难病例 AI 诊疗评测基准

2026 世界人工智能大会医学分论坛上,上海发布业界首个针对疑难病例AI 诊疗评测基准,覆盖 30 个临床专科。同时更新医疗 AI 评测体系至 5.0,新增“原子技能”评测方式。上海市卫生健康行业算力服务中心揭牌。


EVENT-DRIVEN INTELLIGENCE

免费先跟踪重点,再决定是否升级

每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。

分享

NEXT STEP · 留下邮箱

获取下一次重大事件提醒

每天一封精选情报,先用邮件建立复访,再决定是否升级到更深的追踪能力。