07月18日 · 科技早报

天眼早报

科技|2026年07月18日|27 分钟阅读
来源:793 条推文 + 27 篇 RSS 文章·Lanyun·DeepSeek 生成·2026-07-17 — 2026-07-18
分享
AI 速读17 条精选

🤖 AI 大模型

𝕏 Kimi K3 在多个代码基准测试中超越美国模型

中国 AI 公司 Moonshot 发布的 Kimi K3Frontend Code Arena 中首次超越美国模型,并以 57 分 排名 Artificial Analysis Coding Agent Index 第 5。成本仅 $3.18/任务,比 GPT-5.6 Sol 便宜 55%。该成绩引发美国 AI 政策争论,David Sacks 认为美国数据中心限制和模型预审会削弱竞争力。Dean Ball 评价 Kimi K3 在智能体编程中接近 2026 年一季度最佳公开模型。

𝕏 OpenAI 发布 Codex Security 插件

OpenAI 推出 Codex Security插件,可自动扫描代码漏洞GPT-5.6 Sol 在“The Last Ones”网络靶场创下网络安全新 SOTA。

𝕏 GPT-5.6 Terra 在代码审查中速度提升 40%

开发者 @steipete 反馈,将 GitHub 审查机器人 clawsweeper 切换到 GPT-5.6 Terra high,速度提升约 40%,质量损失可忽略,且比 GPT-5.5 更便宜。

𝕏 研究:AI 建议显著抑制人们说“我不知道”的意愿

新论文(arXiv/2607.13562)通过 5 项实验、3132 人发现:有 AI 建议时,人们不愿回答的比例从 44% 降至 3%,错误回答率从 27% 升至 9%。AI 即便给出错误建议,也让用户更自信。

𝕏 AI 前沿模型 8 天内涌现 4 款,智能价格暴跌 2-3 倍

Artificial Analysis 报告:7 月 8 日起 Grok 4.5GPT-5.6、Muse Spark 1.1、Kimi K3 相继发布,前沿模型实验室从 2 家增至 6 家。GPT-5.6 Sol 任务成本仅 $1.04(Fable 5 为 $2.75),Grok 4.5 高配仅 $0.31/任务。Claude Fable 5 仍居榜首但优势缩窄至 1 分。Kimi K3 以 57 分排名第三,任务成本 $0.94。

𝕏 杨植麟 GTC 演讲:月之暗面用 MuonClip、Kimi Linear、Attention Residue 重新定义模型基础组件

月之暗面 CEO 杨植麟在 GTC 2026 演讲中提出用 MuonClip 替代 Adam(训练效率接近翻倍)、**Kimi Linear(KDA)**替代全注意力(6.3x 加速)、Attention Residue 替代残差连接(24% token 效率提升),全部开源。Agent Swarm 支持最多 300 个 Agent 并行。实验表明视觉训练可反向提升文本推理能力。

𝕏 OpenAI 回应 GPT-5.6 误删用户主目录事件

OpenAI确认GPT-5.6在 Codex 完全访问模式下执行清理任务时,可能误删用户**$HOME**目录;公司将更新提示、权限引导和 Harness 安全检查。

𝕏 Arena 新增事实性信号,用于补充人类偏好排名

Arena解释将事实性标签加入Bradley-Terry目标函数,结合人类偏好与事实准确性重排模型。


EVENT-DRIVEN INTELLIGENCE

免费先跟踪重点,再决定是否升级

每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。

分享

NEXT STEP · 留下邮箱

获取下一次重大事件提醒

每天一封精选情报,先用邮件建立复访,再决定是否升级到更深的追踪能力。