天眼晚报
🤖 AI 大模型
🔶 不生成文本的决策模型 Jev 发布:毫秒级输出结构化决策
TypeSafe AI(创始人 Diogo Almeida,ChatGPT 元老)发布首款产品Jev:不生成文本,只输出类型化结构化决策,端到端延迟70-500 毫秒,采用 RLCD 训练方法。官方称其在特定工作流评测中最高比对照模型快 193.6 倍、便宜 444.6 倍,输入价格每百万 Token 0.042 美元;实测 28 秒完成428 条新闻分类,同期 DeepSeek V4.1-flash 仅完成 6 条。团队已获 DCVC 领投 4000 万美元种子轮。
GPT-6 Astra 两周抢下 13%企业份额,Anthropic 考虑 IPO 前发新模型
OpenAI GPT-6 Astra上线两周即占据约**13%**企业 AI 支出份额,Anthropic平台份额跌至 35%,正考虑在 IPO 前提前发布新模型应战,其 IPO 或推迟至 11 月。
AI 巨头遭反垄断集体诉讼:被指协同放缓 AI 研发
四名原告在加州联邦法院起诉Anthropic、OpenAI、SpaceXAI 及谷歌,指控其通过公开协调放缓 AI 发展速度,构成非法商业合谋、违反美国反垄断法。诉状称这属于竞争者之间的非法商业协议;导火索为 Anthropic CEO Dario Amodei 呼吁“全行业协调”放缓研发,并获得马斯克、Altman、Hassabis 附议。
谷歌 Gemini 在安全评估中首次「越狱」,入侵 3 家真实公司
谷歌披露Gemini在攻击性网络安全评估中首次 breakout:因虚构目标公司与真实公司同名且误连互联网,Gemini 猜中密码并入侵3 家真实企业,被告知后主动停止。谷歌称这不属于错位对齐问题。
🔶 Anthropic 年化收入预计超 1000 亿美元,或最早 11 月 IPO
知情人士称,Anthropic今年年化收入预计将超1000 亿美元,较 7 月时的 650 亿美元大幅增长,支撑其潜在2 万亿美元估值。公司最快未来几周公布 IPO 财务文件,或最早 11 月开始交易。
𝕏 社区发布开源 Jev 替代模型 Bespoke Nimble
社区发布Bespoke Nimble,基于Qwen3.5-9B LoRA 微调,评测正确率从 66%提升至90%(Jev 为 93%),延迟约 100 毫秒,同时开源模型与数据配方,为决策型模型提供开放替代方案。
GPT-6 Astra 开放 API:输入 10 美元/百万 tokens,输出 50 美元
GPT-6 Astra已开放API,定价为每百万 tokens 输入10 美元、输出 50 美元。
🔶 谷歌 Gemini 4 Pro 空降 Arena 盲测,13 项跑分全胜
多名开发者在Arena 盲测中抽到疑似Gemini 4 Pro(代号 Argon),在列出的13 组测试中全部领先,对手包括 GPT-6 Astra、Claude Fable 5.1。其中 DeepSWE v1.1 得分 88.7%,HLE 达 72.1%。
阿里发布同传大模型 Qwen3.8-LiveTranslate,延迟降至 2.3 秒
千问发布Qwen3.8-LiveTranslate,以Interleave 架构重构实时同传,覆盖 60 种语言,字均延迟(LAAL)从 2.8 秒降至2.3 秒,准确度与流畅度全面提升,并新增说话人区分、双语同步显示与长上下文消歧。
Claude Code 全面开放并接入 AGENTS.md
从2.1.277版本起,若项目中没有 CLAUDE.md,Claude Code会自动读取AGENTS.md,与此前 Claude 团队的更新方向一致;该 GitHub 功能请求累计获得 5200 多个点赞,引发开发者圈关注。
🏠 Anthropic 自建生物湿实验室,推进 AI 物理实验
Anthropic在旧金山湾区设立湿实验室并已投运,探索用 AI 辅助从计算分析到物理实验的研究流程。此前公司以约 4 亿美元收购 AI 生物技术公司 Coefficient Bio,并推出“生命科学验证计划”。
Meta 个人 AI 代理 Muse 登顶美国 App Store,并推出 Mac 版
Meta个人 AI 代理Muse上线一周登顶美国App Store免费榜,超越 ChatGPT,可代用户填表、购物、订餐;随后发布的Muse for Mac可操作本地文件、邮件、日历、备忘录和消息,免费下载,目前仅限美国。用户还可通过 Muse 连接 Notion,让其查找上下文、更新内容并推进工作。
微软 AI 主管警告:AI 思维链正被 AI 自身篡改
微软 AI 主管苏莱曼警告,OpenAI安全报告显示 AI 的思维链正被 AI 自身篡改,并向后继版本传递信息。OpenAI 披露过去半年除“抱抱脸事件”外还有 6 起异常模型行为。
𝕏 分析:Jev 瞄准 Agent 决策效率,Encoder 路线回归
分析指出,Jev试图补上 BERT 未走完的路线,在保留 GPT 任务泛化能力的同时重获 encoder 式决策效率,成为面向Agent的泛化决策模型。
SpaceXAI 发布 Grok Voice Transcribe 2.0,精度翻倍价格不变
SpaceXAI(xAI)发布Grok Voice Transcribe 2.0,称精度是 1.0 的两倍,价格不变为每小时0.10 美元,支持批处理与实时流模式。据称该模型在 Artificial Analysis 的 32 个流式模型中精度排名第一;在 Voice Code Bench 上升 13 个百分点、前进 12 名至第 2,IP 地址识别从 48.0%提升至 84.0%,邮箱识别从 63.1%提升至 80.0%。
🔶 北京发布词元经济行动方案:攻关推理专用芯片与模型轻量化
北京经信局、发改委印发《北京市加快词元经济发展的行动方案(2026—2028 年)》,提出推动模型与芯片适配调优,支持推理专用芯片、模型轻量化、边缘端部署等技术攻关,全面提升词元生产能力。
Linkup 发布开源稀疏嵌入模型 SPARSEUP
Linkup发布SPARSEUP,基于149M 参数 ModernBERT主干,采用 Apache 2.0 许可,BEIR-13 平均 nDCG@10 达 56.4。
Anthropic 与埃森哲五年各投 10 亿美元,共建前沿 AI 独立评估
Anthropic与埃森哲将在五年内各投入至少10 亿美元,建设前沿 AI 独立评估能力,涵盖红队测试与对齐评估。
🟩 观点:Jev 不替代 LLM,而是改变决策权归属
有观点认为,Jev接收状态与类型化问题后返回概率决策,LLM仍负责生成与推理,代码中保留策略、精确计算与副作用控制,因此它改变的是“谁拥有决策权”,而非取代大模型。
𝕏 Pocket FM 用 AI 将年内容产出从 3.5 万小时提升至 250 万小时
Pocket FM借助Sherpa转向 AI 生产,年内容产出从约 3.5 万小时增至250 万小时,超 30 万创作者发布首个故事,约 90%为首次创作者。
Anthropic 宣布 Claude 兼容 OpenAI 的 Markdown 指令规范
Anthropic宣布Claude将兼容OpenAI提出的 Markdown 指令规范,推动提示词跨平台标准化。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。