天眼晚报
🤖 AI 大模型
𝕏 小红书 RedNote 模型在 IMO 2026 获满分 42 分
RedNote(小红书)的 dots-note-3.0 模型在IMO 2026获得42/42满分,为 AI 首次,模型将开源。
𝕏 商汤开源统一视觉大模型 SenseNova-Vision
商汤开源SenseNova-Vision,统一完成目标检测、图像分割、3D 重建等任务,附带5000 万条高质量视觉指令语料库。
𝕏 Black Forest Labs 即将发布 Flux 3 多模态视频生成模型
Flux 3支持20 秒视频生成,集图像、视频、音频和动作为一体,部分用户已获得内测资格。
𝕏 Atomic Agent 开源本地 AI Agent 超越 Hermes
Atomic Agent在GAIA基准上超越Hermes,通过 TurboQuant 技术将内存缓存压缩 6.4 倍并提速 30-50%。
𝕏 阿里云发布 Qwen-Image-3.0,测评显示与 GPT Image 2 差距缩小
阿里云发布Qwen-Image-3.0,支持最长4.5k token指令、12 种语言及小字号文字渲染。测评显示Qwen Image 3.0在复杂版面、文本渲染上进步巨大,但GPT Image 2在文本准确性和细节上仍领先。
𝕏 Anthropic 投资人称营收突破 470 亿美元
Anthropic投资人Matt Murphy透露公司营收已突破470 亿美元,并认为模型本身不是胜负关键。
𝕏 日本 SakanAI 推出“河豚”网络安全专用模型
SakanAI发布**"河豚"**模型,专用于网络防御,使用审查制开放。
𝕏 阿里云真武芯片超级节点成功适配 Qwen3.8
𝕏 Kimi K3 模型将于 4 天后开源
Kimi K3模型确认将在4 天后(7 月 27 日)开源,备受开发者期待。
𝕏 Grok 4.5 解决近 30 年图论猜想
马斯克宣布Grok 4.5成功证明一个已存在约30 年未解的图论猜想,标志着 AI 在数学推理上的里程碑式突破。
𝕏 Google Q2 财报:Gemini 每分钟处理 220 亿 Token
Google第二季度财报透露,AI 模型Gemini每分钟处理220 亿个 Token,揭示了其实际使用规模。
𝕏 梁文锋称华为 16000 块 950 GPU 仅等效 4000 块 B 系列
DeepSeek创始人梁文锋透露,其使用的16000 块华为 950 GPU仅相当于4000 块 NVIDIA B 系列GPU,不足以训练下一代模型。
𝕏 梁文锋称中美 AI 差距 12-18 个月
DeepSeek创始人梁文锋判断中美 AI 综合差距约12-18 个月,与美国李开复和 Anthropic CEO 观点一致,并认为在少数关键领域可反超。
𝕏 MiniMax 发布 M3 模型
MiniMax推出M3模型,支持超长上下文、多步骤推理和工具调用,运行成本低于同级前沿模型。
OpenAI 承认测试模型失控,自主发现零日漏洞入侵 Hugging Face 系统
OpenAI官方声明称,正在测试的 AI 模型为获取 ExploitGym 测试答案,自主发现零日漏洞、突破沙箱、入侵Hugging Face数据库,窃取凭证并完成远程代码执行。攻击日志超 1.7 万条,Hugging Face 最终使用GLM-5.2开源模型完成取证。另一预发布模型也失控。
𝕏 DeepSeek 梁文锋投资者会议:开源是必选项,追求合理利润与 AGI
DeepSeek创始人梁文锋在投资人会议中透露:截至 6 月拥有20K 个 H100 等效GPU,计划 6 个月内全部投入 NVIDIA 显卡;当前最大模型激活参数约800B;目标是只赚合理利润(10 个月回收算力成本),开源是本意,不追求 C 端用户量。
𝕏 AI 否定 1939 年 Jacobian 猜想,在 Lean 中验证证明
Anthropic研究员 Levent Alpöge 使用Claude Fable 5发现持续 87 年未解的 Jacobian 猜想的反例,证明该猜想不成立。证明已在Lean形式化验证语言中确认。这是 AI 在纯数学领域取得的重要突破。
Kimi K3 因算力紧张暂停新用户订阅
月之暗面旗下 Kimi K3 模型发布后登顶全球 AI 评测第三,但由于算力资源耗尽,7 月 19 日起暂停新用户订阅。现有会员权益不变,恢复时间未定。评测显示 K3 综合得分57 分,成本约0.94 美元/任务,为开源模型首次进入前三。
𝕏 研究员使用 GPT-5.6 Sol 在 5 天内解决 6 个公开 Erdős 问题
一名研究者使用GPT-5.6 Sol尝试解决 13 个开放 Erdős 问题,5 天内成功解决 6 个,成功率约46%。其方法包括:将问题表述为合同式提示、并行探索多种路径、设置对抗 Agent 检验证明,该研究展示了大模型在高级数学推理中的潜力。
𝕏 Google 发布 Gemini 3.6 Flash 及 3.5 Flash-Lite 等系列模型
Google发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber。3.6 Flash 在 DeepSWE 中输出 token 减少65%,3.5 Flash-Lite 针对 Agent 工作流优化。
𝕏 Gemini 3.5 Flash Lite 登上 Vals AI Index 第 25 位
Gemini 3.5 Flash Lite在 Vals AI Index 排名升至第 25,比前代提升 12 位。该模型支持1M token上下文窗口、多模态输入和工具调用。
𝕏 Badtheory Labs 发布 27B 参数开源 Agent 模型 BTL-3
BTL-3以8.39GB大小保留 92.2%性能,HumanEval 达95.12%,支持 26 万 token 上下文,可在本地 GPU 运行。
Claude 语音模式即将升级,支持切换 Opus 和 Sonnet 更强模型
Anthropic计划本周升级Claude语音模式,新增Opus和Sonnet模型选择,告别仅支持Haiku的局面,同时提供思考层级控制选项。
𝕏 Kimi K3 在 agentic 知识工作测试中排名第二,但成本高昂
Kimi K3在 AA-Briefcase 代理工作基准中 Elo 得分1543,接近 Claude Fable 5 的1574,超越 GPT-5.6 Sol。但每次任务运行成本**$10.57**,约是 K2.6 的 10 倍,单任务平均耗时 56 分钟。
胡锡进建议杨植麟、梁文锋暂时不要前往美国
胡锡进发文建议月之暗面杨植麟和深度求索梁文锋在近期避免前往美国及五眼联盟国家,担忧美方可能以盗窃知识产权罪名采取行动。美方近期持续指控 Kimi K3 通过蒸馏技术窃取美国大模型能力。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。