天眼早报
🤖 AI 大模型
Anthropic 为 Claude Code 推出 mods,可深度定制界面与行为
Anthropic 为 Claude Code 推出 mods 功能,开发者可用 JavaScript/TypeScript 函数挂钩内部事件,重写提示词、拦截工具调用、替换界面组件或新增功能,实现更深度的定制。mods 随插件分发,现已支持 CLI 和桌面版;官方提示 mods 与 Claude Code 权限相同且不设沙盒。
𝕏 Trillium Labs 成立:开源前沿 AI 研究的非营利组织
Natolambert 等创立非营利组织 Trillium Labs,专注前沿 AI 开源科学研究,将开源后训练配方并扩展至开放基础设施,研究 RSI、奖励黑客与多智能体系统,获 Halcyon Futures 和 Schmidt Sciences 初始支持。
🟩 AllenAI 发布 AstaBrief 8B 开源模型,单次前向生成带引用科学报告
AllenAI(Ai2)发布开源权重模型 AstaBrief 8B,基于 Qwen3-8B 微调,接收研究问题与文献片段后单次前向生成带 引用 的科学报告。平均耗时 51.1 秒,比 Claude 多步管线快约 3.5 倍,采用 Apache 2.0 许可。
OpenAI 发布 GPT-6 系列模型使用指南
OpenAI 于 10 月 2 日发布 GPT-6 系列模型指南,介绍如何在 GPT-6 Astra、GPT-6.1 Sol 和 GPT-6 Luna 之间按任务选择,并给出推理强度、速度模式、提示词写法及长时间任务管理、上下文缓存压缩等实践建议。
𝕏 MiniMax 开源自托管 OpenAI Agents API:OpenAgentCore
MiniMax 开源 OpenAgentCore,提供与 OpenAI Agents API 兼容的接口,应用代码不改、更换地址即可。支持 Docker、E2B、microsandbox 等沙箱,每个 Session 可选 Codex、Claude Code、MiniMax Code 等 Harness。
▶️ OpenAI 推出 Dots 商用智能体平台,可跨应用协调 Codex
OpenAI 推出 Dots,定位商用优先的 AI 助手与智能体平台,最低月费 100 美元,可启动网站、调整日程、制作董事会幻灯片;用户可命名专属智能体,它跨应用保留上下文、协调 Codex 任务并标记待办事项。目前每人限一个,未来支持多个。与 Anthropic 的 Muse 形成竞争,聚焦智能体助手市场。
英伟达 GPU 加速 OpenAI GPT-6 Astra Ultrafast
英伟达 称 GPT-6 Astra Ultrafast 运行在 Blackwell GPU 上,token 生成速度比 Astra 标准模式快 8 倍,已上线 OpenAI API 并向 ChatGPT Work 与 Codex 用户开放。
𝕏 Agent Arena 更新:GPT-6.1 Sol 第五,Claude Sonnet 5.5 第三
Agent Arena 最新排名公布:OpenAI GPT-6.1 Sol 位列第五,净提升 +11.23%,单任务中位成本 0.56 美元,比 GPT-6 Sol 低 39% 而得分高 1.52 分;Anthropic 的 Claude Sonnet 5.5 首登第三,净提升 +12.5%,聊天类目第一,但单任务中位成本 2.74 美元,高于 Opus 5.5 的 1.58 美元。
𝕏 WeirdML v3 评测:GPT-6.1 Sol、Sonnet 5.5、Grok 4.7 成绩公布
WeirdML v3 评测显示,GPT-6.1 Sol token 效率高且接近 Astra,但峰值较低;Sonnet 5.5 得分超过 Opus 5;Grok 4.7 领先 Kimi-K3。
𝕏 Sigil 发布私人 AI 助手 Underdog,获 a16z 等投资
Sigil 推出私人个人 AI 助手 Underdog,获 a16z、Khosla Ventures、Hummingbird 投资,基于 Hugging Face hub 运行,主打在本地设备上运行个人 AI。
𝕏 Prime Intellect 发布 Prime Inference,日处理近万亿 token
Prime Intellect 推出 Prime Inference,其开源推理栈日处理近 万亿 token,覆盖 RL rollout、合成数据与长时程智能体,现提供无服务器端点和预留算力,支持 OpenAI SDK 接入。
𝕏 Opus 5.5 靠写代码创作中文书法作品
用户让 Claude Opus 5.5 创作中文书法,模型通过写代码模拟墨、纸与印泥,经 五六轮 迭代生成《尚书·舜典》十四字行书,并自撰介绍说明创作过程。
𝕏 DeepSeek 发布 Ascend,被称对英伟达的警示信号
DeepSeek 发布 Ascend,评论认为其远不止一个新 checkpoint,而是对 英伟达 的警示信号,但媒体与智库关注度偏低。
🏠 腾讯 WorkBuddy 独家接入 Space Bunny 大模型
腾讯 WorkBuddy 宣布国内独家接入匿名 Flash 大模型 Space Bunny,其支持 100 万 token 上下文、文本/图像/视频输入,9 月 27 日在 OpenRouter Token 调用量约 3.99 万亿,连续三天位列第一。
𝕏 谷歌发布 Gemini 4 Argon 等模型,支持 100 万 token 输出
谷歌 9 月 AI 发布:推出前沿模型 Gemini 4 Argon,支持 100 万 token 输出上限;并发布 Gemini 3.8 Live 语音模型、Googlebook 笔记本及天气预测模型 WeatherNext 3。
𝕏 ElevenLabs 发布 Eleven v4 语音模型,接入 ElevenReader
ElevenLabs 将最富表现力的语音模型 Eleven v4 接入 ElevenReader,支持 iOS、Android 和 Web,可用自选声音听读任意文章、电子书或 PDF,覆盖 90+种语言。
𝕏 韩国 Upstage 发布 Solar Mini 4 模型
韩国 AI 公司 Upstage 发布 Solar Mini 4,35B 总参数、3B 激活参数,评分高于 Qwen 3.6 35B 但低于 Qwen 3.8,适合处理重复的自动化任务。
𝕏 llama.cpp 本地支持决策模型,免费快速且隐私
llama.cpp 上线决策模型支持,新增 /v1/systemone 端点,可本地高效运行多个开源模型,已随最新构建发布,后续将支持更多模型。
𝕏 开发者反馈 Grok 4.7 表现不佳,不如 4.6 和 GLM 5.3
开发者 vikingmute 反馈 Grok 4.7 在一个 bug 上尝试 5 次 仍未定位,反而质疑用户;Sol 6 与 GLM 5.3 Flash 均一次找到原因,认为其体感最差。
𝕏 Opus 5.5 展示完整游戏与 3D 世界生成能力
Opus 5.5 被用于生成完整游戏、3D 世界 与音乐视频,用户仅给出一个提示词加音乐,12 小时 后即产出成品,游戏开发流程或将被重塑。
Wagtail 团队用 GLM 5.3 Flash 编码一个月体验
Wagtail 团队分享使用 GLM 5.3 Flash 进行 一个月 编码的实测体验,讨论其在真实开发工作流中的表现。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。