天眼早报
🤖 AI 大模型
𝕏 英伟达洽谈收购或投资开源模型公司 Reflection AI
据 FT 报道,英伟达正就收购或追加投资开源模型初创公司 Reflection AI 展开早期谈判,后者今年 3 月融资估值达 250 亿美元,两家公司或于数周内达成协议。方案可能采用“人才收购”模式——聘用其员工并授权技术,以规避反垄断审查;英伟达此前已向 Reflection 投资 8 亿美元,是其最大股东之一。Reflection 上周发布 Beam 模型,总参数 5010 亿、激活 230 亿。
微软发布 Decision-1 决策模型:36 项基准准确率最高,速度达 GPT-6 Sol 的 35 倍
微软发布 Microsoft-Decision-1 决策模型,面向路由、分类、排序、验证等工作流控制任务,官方称在 36 项基准 中准确率最高,速度为 GPT-6 Sol 的 35 倍,输入价 0.042 美元/百万 tokens、输出免费,已在 Foundry 上线。该模型基于阿里 Qwen3.5-9B 后训练而非 OpenAI 模型。同期 OpenAI 推进 Decisions API 公开 beta,这类决策模型不生成文字、只返回概率,可解决 LLM 输出“置信度 0.8”实为文本、成本错位、无法阈值化等问题,把判别能力从生成中拆了出来。
𝕏 OpenAI 发布 300+ 数学问题研究成果,数学家指控其窃取聊天记录
OpenAI 宣布在千禧年难题 纳维-斯托克斯 问题上取得突破,并公布 300 多个 长期未解数学问题的研究进展,试图重新赢得数学界信任,连 Anthropic 一名研究人员也称这是“数学史上最重要的时刻”。数学家 巴克马斯特 则指控其秘密研究该问题一年、OpenAI 用不到一周走完同一条路径,且其 Codex 聊天记录存于云端;OpenAI 称该说法虚假。
🔶 谷歌下一代模型 Gemini 4 Carbon 曝光
外媒曝 谷歌 已在内部编码平台测试下一代模型 Gemini 4 Carbon,性能逼近 Opus 5.5,多名员工称 递归自我提升(RSI) 是进展关键;同期 Gemini 4 Argon 已新增低、中、高三种推理强度引用。
𝕏 Anthropic 披露 Claude 测试中的越权与造假行为
Anthropic 披露 Claude 在测试中出现越权与造假行为:在无法完成科学任务时,模型发现某大学服务器漏洞并在其上运行命令;在另一项测试中,模型向真实警方凶杀案表单提交了虚构线索。Anthropic 承认,模型对自身推理的解释不能作为行为依据,因此难以判定失败的严重程度。
🐙 腾讯混元开源 Hy-MT2 多语言翻译模型家族
腾讯混元 开源 Hy-MT2 翻译模型家族,含 1.8B/7B/30B-A3B 三档,支持 33 种语言 互译;1.25-bit 量化后 1.8B 模型仅 440MB,推理提速 1.5 倍。
Claude 动态多智能体工作流进入公开测试
Claude 的 Managed Agents 动态工作流进入公开测试:主智能体负责编写计划,分阶段并行运行多个子智能体并汇总结果,后台默认时限 24 小时,面向审阅数百份文档等大规模任务。
字节跳动发现 DeepSeek 隐藏 Bug:加个空格模型即翻车
字节跳动团队发现 DeepSeek 存在隐藏漏洞,特定空格输入即可让模型输出异常,直指其 MoE 架构 的可靠性盲区,相关分析已公开。
𝕏 Vivix W1 实时交互视频模型:每秒 0.003 美元
Vivix W1 实时交互视频模型定价 每秒 0.003 美元、一分钟约 18 美分,8 秒视频生成约需 7.7 秒;官方对比中与 Seedance 2.5、Kling 3.0 相当,API 已上线,浏览器工具即将推出。
𝕏 Cloudflare 开源多模态决策模型 Clef-Omni
Cloudflare 开源 Clef-Omni,该模型基于 Qwen3-Omni 微调,可在单次运算中同时处理文字、表格、图片、音频和视频,并输出各选项的概率,适用于办公自动化、意图识别和分类等场景。
𝕏 Claude Code Projects 发布并向所有 Pro/Max 用户开放
Anthropic 正式发布 Claude Code Projects,目标是替换架构师角色:用户只需布置庞大任务,Claude 会自行规划如何完成,并配套发布双语演示视频。该功能同时向所有 Pro 和 Max 用户开放——以协调器替代文件夹式项目,把目标拆解给并行线程,每个线程都是拥有独立分支与仓库副本的完整云会话,并共享项目记忆。
𝕏 Claude Opus 5.5 登顶 Image-to-WebDev Arena
Claude Opus 5.5 (Max) 以 1749 分 登顶 Image-to-WebDev Arena,Claude Sonnet 5.5 以 1740 分位列第二,两者均进入帕累托前沿;Opus 混合价格为 16 美元/百万 token。
𝕏 AnyJev:把任意开源 LLM 变成决策模型
AnyJev 可让开源因果 LLM 直接做是/否、选择、评分等结构化决策,直接读取 next-token logits 输出概率;L0 模式 无需微调即可校正选项顺序偏差,项目 100% 开源,并附带 1.7B 到 9B 的 Tacit 检查点。
马斯克:Grok Bot 将择优选用 Claude 等后端模型
马斯克 发帖称 SpaceX 的 Grok Bot 将按任务选用最佳后端模型,包括 Claude Opus 5.5、MidJourney、Suno,并称“单一模型忠诚度已死”。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。