今日 Story

Alibaba Cloud 官方账号先把 Qwen3.8-Max 定位为持续在线的工作搭档,列出编码、推理、研究、写作和 AI Agent 五类任务,并确认用户可从产品与 API 试用。这解决了模型是否公开亮相的问题,却没有交代规模、基准、价格、开放权重时间和地区边界。

完整发布资料随后补上技术与工作流信息:模型为 2.4T 总参数、95B 激活参数,兼容 OpenAI Responses 与 Anthropic 协议,可调 reasoning effort。官方案例包括约 16 天构建 oh-my-cli,产生 265 次提交、127 个 PR 和 151 个 issue;另一项科研复现持续约 125 小时。官方还承诺下一周开放权重,并给出 Terminal Bench 2.1 为 86.6、PaperBench 为 93.0 的自测结果,但依然没有公布 API 定价。

这个空白很快被社区说法填上:Bindu Reddy 称输入每百万 token 2 美元、输出 6 美元、隐式缓存 0.25 美元,并称模型将在本周开源。2.4T 规模与完整资料相符,开放时间也大体接近官方承诺,但价格和缓存数字没有官方页面支撑;“开放模型第一”和达到 Sonnet 级别同样是作者判断,而非独立评测。模型已经可以进入兼容性试跑,预算和迁移决定则仍缺关键一块。

编辑判断:这次发布把采用决策拆成了三个信息层:官方短帖确认产品存在与用途,完整资料证明接入方式和厂商自测能力,社区则替官方填补经济性空白。三层合起来说明它已经足够开始技术验证,却还不足以进入成本承诺;团队应把冒烟测试与预算迁移分开,直到定价、缓存计费和实际可用范围获得官方确认。

证据状态:模型发布、规格、协议与案例来自官方材料;基准均为厂商自测,社区给出的价格、缓存费用和领先判断尚无官方价格页或独立评测确认。

来源

今日快讯

01模型、评测与路由

2
1Anthropic Gen-5 (Fable 5 / Opus 5 / Sonnet 5): measurably worse nonsense detection + ~2x verbosity — issue with reproducible measurementsReddit · r/ClaudeCode

一名 Claude Code 用户用开放的 BullshitBench 对 Anthropic 第 5 代模型做了带样本量和置信区间的测量。按其报告,Fable 5 的无意义前提识别率为 0.41—0.47,Opus 5 与 Sonnet 5 为 0.49—0.74,而第 4.6/4.8 代为 0.83—0.95;在相同推理强度下,Opus 5 输出 token 多 107%,Sonnet 5 多 84%。作者还声称 Fable 5 会转路由到 Opus 4.8。题集、样本数和统计方法让它比普通体感帖更可复核,但原始结果、脚本控制和路由判定尚未独立检查。对日常使用最合理的动作不是立即下结论,而是拿自己的重复任务固定提示、版本和推理强度,比较正确率、输出长度与额度消耗。

2I switched to sonnet 5 and now my max sub is unlimitedReddit · r/ClaudeAI

一名同时使用 Claude 与 Codex 订阅的开发者称,过去主要依赖 Fable 和 Opus,改用 Sonnet 5 后,日常编码反而更省时间与周额度。他的单次对比是:Fable 一轮约耗 20 分钟和 20% 周额度;Sonnet 虽需 2—3 轮提示,总计约 10 分钟便得到他认为相同的结果。样本只有一个未披露任务,不能当作模型排名,但方法可直接复用:复杂任务留给高成本模型,常规改动用轻量模型,并以端到端完成时间和额度而非“一次成功”做路由。

02Agent 工程与交付

8
3Don't be a meat proxyHacker News

“不要做人肉代理”把 AI 协作里最常见的责任转移说得很具体:把 Claude 的长答、代码审查意见或工单原样来回复制,看似在推进任务,实际是把补上下文、辨别术语和核验错误的成本交给接收者。作者给出的最低交付标准是先读懂、验证,再用自己的话回答;放到代码审查中,开发者若只负责转发,真正承担实现判断的人就变成 reviewer。文章基于经验而非效率实验,但它划出了一条实用边界:团队评估 Agent 工作流时,不应只看生成了多少内容,还要看提交者能否解释决策、复现验证并对结果负责。对管理者而言,最该写进团队规范的不是禁用 AI,而是要求交付包含人的判断痕迹。

4Devtools must be open sourceHacker News

David Crawshaw 提出,编码 Agent 同时降低了软件首次个性化和长期跟进上游的成本,因此开发工具的源码正在变成新的扩展接口。具体工作流是:让 Agent 拉取源码、按个人需求改造并把动机记入版本控制,再由夜间任务同步上游、rebase 本地修改、运行测试并替换当前版本。作者用 Shelley 把 diff 精简能力接入图形界面,说明很多扩展点不必等插件 API 预先设计。这个判断的吸引力不在“一句话加功能”,而在维护成本也被纳入自动化;真正的门槛则是测试、失败回滚和长期 rebase 成功率,文章没有给出这些数据。对工具团队来说,开放源码因此不只是分发方式,也可能成为产品可定制性的核心资产。

5Launch HN: Hoplite (YC S26) – Effortlessly deploy cloud coding agentsHacker News

Hoplite 把云端编码 Agent 做成按任务线程隔离的开发环境:它能读取仓库、运行测试、启动实时预览,用持久 Chromium 走查用户流程,创建 Pull Request 后继续处理评审反馈,并把重复浏览器流程保存为 QA 资产。团队自建 Agent harness,基础设施主要落在 AWS,并使用 Temporal、Modal 与 PlanetScale;发布期还提供 100 美元额度,并允许连接 Codex 订阅。现阶段最关键的限制是,本地转云端不会自动带上未提交的文件系统变更,成熟项目的 Docker Compose 和私有依赖也不一定能直接迁移。它的差异化不是“又一个远程写代码工具”,而是把预览、浏览器验证和评审闭环放进同一线程;是否值得采用,取决于项目能否稳定复刻开发环境。

6[Trending] esengine/DeepSeek-Reasonix: DeepSeek-native AI coding agent for your terminal. Engineered around prefix-cache stability — leave it running.GitHub

Reasonix 是一个以 DeepSeek 为预设、同时兼容 OpenAI 风格端点的终端 coding agent,当前默认分支已改写为单体 Go 二进制。它把 provider、模型、Agent、工具与插件集中到配置文件中,允许 planner 与 executor 使用两个缓存稳定的会话;插件通过 JSON-RPC 接入并兼容 MCP,上下文维护则保留稳定启动前缀、裁剪旧工具输出并在压缩前清理噪声。项目覆盖 CLI、桌面端和编辑器扩展,提供六类主流平台预编译目标;快照约 2.98 万星。它的产品假设很清楚:长会话的成本问题可以通过前缀稳定性来解决。不过 README 没有独立成本对照,所以当前更适合把它当作可研究的上下文工程实现,而不是已经证明更便宜的替代品。

7[Trending] livekit/agents: A framework for building realtime voice AI agents 🤖🎙️📹GitHub

LiveKit Agents 把实时语音 Agent 的听、说、看和工具调用统一成服务器端可编程参与者。开发者可组合 STT、LLM、TTS 与 Realtime API,并直接使用作业调度、WebRTC 客户端、电话呼入呼出、RPC、数据通道、语义轮次检测、MCP 和带 LLM judge 的测试框架;Python 与 JavaScript/TypeScript 路线均可用,底层服务也能自托管。仓库快照约 1.19 万星。真正影响上线成败的不是对话提示本身,而是首 token 延迟、单通成本、转写到模型再到语音的分段追踪,以及失败录音的复盘能力。框架已经把实时交互和测试拼到一起,但生产团队仍应在第一天就设计录音、转写、链路追踪和成本监控,否则延迟问题很难定位。

8Prevent cognitive debt by manually retyping LLM-generated codeHacker News

Ankur Sethi 为避免“代码生成了却不理解”的认知债务,把个人项目中的 Agent 默认限制为只在聊天里提出代码和命令,未经再次授权不得改文件、装依赖或改变仓库状态,随后由自己逐行输入。他自估这种方式只有约 2 倍提速,却能迫使自己核对 API、发现幻觉和设计问题,并形成代码库的空间地图。收益来自数月个人观察,没有缺陷率或维护时间对照;它更像一种极端训练模式。可借鉴的不是机械抄写全部代码,而是在陌生模块、高风险迁移和学习型项目中主动保留理解环节。

9Why Graph Engineering will 10x your Claude/CodexYouTube · Greg Isenberg

这段 26 分钟视频把 graph engineering 定义为管理 AI 工作流本身:prompt engineering 管提问,context engineering 管输入,graph engineering 则把任务拆成带状态的 job 与连线,使流程可观察、可复用。简介以 Shopify AI 记账产品为案例,并给出白板画 lane、轻量自动化、LangGraph 或 n8n 三层落地路径。现有材料不足以验证标题里的“十倍”,但它仍适合正在把 Claude 或 Codex 从单轮聊天升级为持续流程的产品和工程负责人,用来建立节点、状态与失败处理的共同语言。

10GTA 6 first attempt. Far from perfect, but it's impressive what the right harness and agentic loops can build.Reddit · r/ClaudeAI

一名开发者用 Gauntlet Loop 和 Claude Code 制作 GTA 风格 3D 原型,第一次只生成基础世界便停滞;增加多轮反馈后,累计投入 22 小时、调用 86 个 agents,才得到仍很粗糙的版本。最可复用的发现是:Claude Code 无法直接理解玩法视频,单纯抽帧反馈也有限;导出描述游戏状态的结构化 JSON 后,Agent 更容易判断世界里实际发生了什么。项目没有仓库、成本和复现实验,但它提醒复杂 Agent 任务的瓶颈常在反馈接口,而非再加一轮提示。

03开发者基础设施

3
11[Trending] firecrawl/pdf-inspector: Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.GitHub

Firecrawl 的 pdf-inspector 用纯 Rust 先把 PDF 判成文本型、扫描型、图片型或混合型,再只把需要的页面送去 OCR。它通过采样内容流操作符完成分类,README 给出的耗时约 10—50 毫秒,文本型文档可在本地 200 毫秒内处理;同时保留文字坐标与多栏阅读顺序,并提供 Python、Node.js 和浏览器 WebAssembly 绑定。项目在 200 份 PDF、关闭 OCR 的自报基准中取得 0.875 总分,顺序处理耗时 0.470 秒,快照约 7916 星且单日新增 1769 星。基准来自项目方且不覆盖扫描件,不能直接外推全部文档。对 RAG 和批量摄取系统,最值得立即采用的不是换解析器,而是把 OCR 从固定步骤改成逐页路由决策。

12[Trending] Alishahryar1/free-claude-code: Use Claude Code, Codex and Pi for free from your terminal, app, IDE, or phone like OpenClaw (voice supported)GitHub

Free Claude Code 实际不是绕过付费,而是一个本地 provider 代理:用户仍在 Claude Code、Codex 或 Pi 的原生终端与 IDE 中工作,只把请求转到自己选择的云端或本地模型。它列出 31 个 provider,支持为不同模型角色配置路由,并尽量保留流式输出、工具调用、推理和图片输入。项目快照约 4.4 万星,但独立使用报告仍少。由于代理承载 API key 与登录态,安装前应先审查安装脚本、鉴权设置和各 provider 条款,再决定是否让它进入主力开发环境。

13I got tired of explaining my screen to AI chats, so I built an open-source desktop AI that reads your screenReddit · r/SideProject

MudrikNow 是一款仅支持 Windows 的开源桌面助手,按 Alt+Space 后通过 UI Automation 读取当前窗口的按钮、字段、标签和值,并可结合截图交给用户自带的 Gemini、Anthropic、OpenAI 或 Ollama 模型。它的 Auto-Guide 不直接接管操作,而是指向下一步控件并等待用户点击;作者还声称 shell 只读、界面操作受允许列表约束且无遥测。项目仍是预览质量,也没有独立安全审计。它适合先在低风险任务中试用,核心价值是把“看屏幕”从反复口述变成结构化上下文。

04Claude Code 认证与计费

2
14Warning for those that haven't experienced this yet.Reddit · r/ClaudeAI

这条虽然属于认证与计费风险,但会直接改变 Claude Code 用户的凭证配置方式,因此破例进入快讯。一名每月支付 200 美元订阅费的用户称,他为测试把 API key 放进本地环境后,另一个终端会话也开始走 API 计费,直到消费接近自设的 20 美元提醒才发现。现有材料没有日志、版本和账单,无法确认是环境变量继承、客户端行为还是显示问题。可执行的做法是把测试密钥限制在单个进程或项目,启动新会话后检查认证来源,并为 API 设置硬额度。

15Massive Phantom Usage Bug draining Pro/Max plans (Card charged $480+). Zero support and Discord bans for asking.Reddit · r/ClaudeCode

这条虽然属于账户与计费风险,但它要求 Claude Code 订阅用户立即核对用量和限额,因此破例进入快讯。一名 Max 20× 用户称,删除会话、撤销 OAuth token 并启用 2FA 后用量仍增长,信用卡最终被收取 480.11 美元;他还把现象与公开状态页的延迟和重路由事件联系起来。账单、服务端日志和因果链都未独立确认,不能把后端故障当成定论。实际动作应限于核对活跃会话、额度、账单与 token 撤销效果,异常时保留时间线并尽快联系支持。

05产品化、商业与增长

7
16Why smarter AI models could drive up compute prices 10xNewsletters · Dwarkesh Patel

Dwarkesh Patel 用一个限时写作的思想实验解释:更聪明的模型短期内可能推高算力价格,而不是让它更便宜。文中称 Anthropic 收入同比约增长 10 倍,实验室算力供给每年约增长 3 倍;若收入继续更快增长,差额会体现为更高利润、更高租价或更多算力转向推理。他还引用交易估算,Google 为 11 万块 GB200、GB300 混合 GPU 每月向 SpaceX 支付约 9 亿美元,并推演人类水平的软件工程 Agent 可能把一块 H100 等效设备的年价值推到 25 万美元以上。后一个数字高度依赖能力、劳动价值和供给弹性,作者也承认部分判断只是直觉。对创业者的现实含义是:不要把未来模型降价写进商业模型,先测试单位任务价值能否覆盖价格上行。

17Show HN: Isopolis – Isometric pixel map of SFHacker News

Isopolis 把旧金山约 121 平方公里做成可连续缩放的等距像素地图,完整展示了图像模型、编码 Agent 与人工品控如何拼成一个可交付 side project。作者先渲染 440 个基础方块,再用 101 对人工筛选样本扩展出 1515 个训练样本,训练约 55M 参数的 LoRA;两次 H100 训练各耗时 2—3 小时、约 10—15 美元。为处理接缝与海面幻觉,推理改成 1519 次重叠生成,最终发布 3570 张瓦片,仍由作者花约 1 小时检查并标记约 200 个区域。项目说明 Agent 可以压低实现成本,但视觉交付仍需要抽样与人工验收。复用前还必须处理数据授权,因为作者明确承认抓取 Google 3D Tiles 违反其服务条款。

18Accidentally built a userbase in a dying niche. Not sure what to do. I will not promote.Reddit · r/startups

一个被放弃约两年的 AI 健身网站,因为站名后来对应流行的 looksmaxxing 搜索词,意外积累约 5000 个注册用户,甚至有人继续在破损产品里发帖。作者用一个月把产品从体型分析转成自拍反馈与常见护理建议,随后又新增约 1000 个注册,但收入仍为 0:Amazon 联盟推荐几乎不转化,主观 AI 反馈难以直接收费,登录墙又妨碍广告。用户数、渠道和转化都来自作者自述,却构成了一个很清楚的产品教训:搜索流量替你改写定位,不等于它也替你找到付费理由。下一步不该继续堆分析功能,而应先访谈留存用户,确认他们反复回来完成什么任务、愿意为哪种持续结果付费,并处理外貌焦虑场景的责任边界。

19i made a nokia 3310 space impact remake for apple watch in 2021. shipping it to iphone this july tripled my impressions and i never announced itReddit · r/SideProject

一名独立开发者把 2021 年上线、售价 1 美元的 Apple Watch 老游戏扩展到 iPhone 和 iPad,没有做发帖、邮件或推文宣传,却称曝光约增至原来的 3 倍,销量增长 200%。更大设备市场和较弱的 iPad 榜单竞争可能是原因,但同一次更新还重写了关键词并更换截图,所以无法拆分贡献。这个案例适合当作实验设计提醒:跨平台、商店关键词和素材应尽量分批变更,并记录绝对曝光、转化与收入,否则增长结果无法指导下一轮动作。

20Claude built me a multiplayer ant tree gameReddit · r/ClaudeAI

一名创作者把原有钓鱼采集游戏的排行榜改造成浏览器多人蚂蚁树,加入永久纸条、实时聊天、玩家可见性和阵营贡献。作者称没有手写代码或使用 Blender,而是组合 Claude Code、GPT Codex、Grok、Gemini、Meshy、Suno 与 After Effects 完成代码、音视频和 3D 资产。制作时长、成本和线上稳定性都未披露,因此不能推导普遍效率;但案例清楚显示,多模型产品化的难点已从单一生成转向素材分工、世界观一致性和最终集成。

21Stop Trying to Build a Unicorn. Start Cockroachmaxxing.Newsletters · Joan Westenberg

JA Westenberg 主张独立创业先追求“不死”:让月收入持续高于月支出,同时守住心理状态、创作动力和项目寿命。她通过低成本或开源工具、软件替代和技能交换压低 burn rate,从第一天收费来过滤高要求免费用户,并直接联系每周支持自己的 10 个人;日常写作目标合计至少 2900 字。文章没有 MRR、节省比例或转化率,因此不是经验证的增长模型。可复制之处是把 runway、现金流、直联客户和稳定产出变成每日约束,而不是等待一次爆款。

22I give up trying to use Reddit to grow my SaaSReddit · r/SaaS

一名 19 岁 SaaS 创作者决定放弃把 Reddit 当主要增长渠道。他总结的常见打法包括直接发创业故事、在痛点帖中先帮助再提产品、长期贡献后把链接放在个人资料;但前者容易被当推广,后两者又让他感觉自己带着隐藏议程。帖子没有发帖次数、点击、转化或收入数据,不能证明 Reddit 普遍无效。它提出的真正问题是渠道与身份是否匹配:如果一种增长方式长期要求创作者伪装动机,持续成本可能高于可归因流量,应该换到允许明确商业意图的场域。

X 热点

01模型、厂商与产品发布

10
1@OpenAI官方

OpenAI 宣布,一个尚未命名的下一代主要模型内部版本,在长期未解的数学与理论计算机科学问题上产生了 10 项新结果;按 GPT-5.6 Sol API 费率估算,所用 token 成本约为 2000 美元。官方列出的领域包括球堆积、编码理论、群论、量子复杂性、格密码和极值组合学,其中两项具体结果是证明非 sofic 群的存在,以及指数级改善高维球堆积的界限。

OpenAI 同时发布论文手稿、Lean 形式化证书和推理过程说明,供数学家检查并继续研究。这比只公布基准分数多了一层可审计材料,但推文中的十项成果及其重要性仍是官方陈述,不能把材料公开等同于全部结果已完成独立同行评审。模型名称、完整推理成本口径和人工参与程度也未在该线程中说明。若这些结果经外部验证,意义在于前沿模型开始从解题辅助走向可检查的新知识产出,而 Lean 证书会成为区分发现主张与可验证证明的关键接口。

2@vista8个人体验/产品推荐

向阳乔木推荐 YouMind 的「精灵」功能,并列出两个使用入口:绑定微信后,可在微信中调用国内外模型进行对话和生图;安装桌面客户端后,可用 Command + J 随时唤起精灵,完成 PPT、写作和网页生成,交互方式被作者类比为 Raycast AI。帖子获得 22 次点赞、4 次转发、51 条回复和 18432 次浏览。这是个人推荐,不是厂商规格页或独立评测;原文没有说明可选模型清单、价格、响应质量和数据权限。

3@athyuttamre公开需求征集

Atty Eleti 在 X 上公开询问用户:ChatGPT Voice 最应该修复或新增的第一件事是什么。问题本身没有列出备选功能,也没有承诺进入路线图,但获得 693 次点赞、32 次转发、739 条回复和 125262 次浏览,形成了一个集中收集语音产品痛点的入口。现有材料没有回复正文,也没有说明作者在 ChatGPT Voice 团队中的具体职责,因此不能据此总结用户需求排名;可确认的是,帖子采用只选第一优先级的问法,迫使反馈者表达取舍。

4@OpenAI官方发布/架构说明

OpenAI 用三帖介绍 GPT-Live 的语音架构改造。官方称模型现在可以在说话时继续聆听,为此从客户端到模型重建了语音栈:音频通过专用快速通道持续流动,较深的推理和工具调用则异步执行,从而避免这些任务打断对话。团队还把语音会话启动从 6 次网络往返减少到 1 次,目标是让会话从开始阶段就更快、更自然。

这些数字和效果来自 OpenAI 官方发布,原帖没有给出端到端延迟、并发负载、丢包环境或独立对照测试,因此架构变化可信度高,性能幅度仍需更多测量。其工程意义在于把实时音频与慢速推理拆成不同路径,语音 Agent 不必在低延迟交互和工具能力之间二选一。

5@genspark_ai官方发布

Genspark 官方宣布开源 GenOffice Alpha,这是一款面向 PC 和 Mac 的 AI 办公套件,提供 Docs、Sheets、Slides 和 PDF 编辑工具,免费且无广告。内置的 Genspark Super Agent 可调用多种模型执行研究、数据处理、文档写作和演示文稿制作,Agent 功能会消耗用户的 Genspark credits。

官方称 Alpha 由 1 名工程师用 1 周完成,模型 token 成本为 10000 美元。产品还把反馈环节做成 Agent 工作流:用户加入 GenTeam 中的 GenOffice 群组,直接描述需要的功能,由 Agent 协助迭代;提交真实反馈的参与者可获 1000 个以上 credits

这是官方发布信息,足以确认产品定位、Alpha 状态和公开承诺,但「全球首个全功能开源 AI Office」以及开发成本、开发周期仍是厂商自述,线程也没有提供独立评测。真正需要后续验证的是仓库许可证、传统编辑功能的完成度、Agent 生成质量,以及免费编辑与 credits 消耗之间的实际成本边界。

6@paulg专家观点转述

Paul Graham 提出一个关于模型能力进展的解释:大模型数学能力提升更快,并不是因为数学本身更容易,而是数学通常有清晰的正确与错误答案,因此更容易构造训练反馈;写作质量缺少同样明确的判定标准,优化起来更难。他称这一解释来自自己询问的一位专家,但没有披露专家身份、训练实验或论文依据。

这条观点把能力差异指向「反馈可判定性」,而非简单归因于任务难度。对模型评测和产品设计的实际启示是:只要能把模糊任务转成可验证的中间结果,训练和 Agent 工作流就更容易迭代;但该帖仍是二手解释,不能证明反馈清晰度是数学与写作表现差异的唯一原因。

7@bindureddy厂商自述

Abacus AI 的 Bindu Reddy 介绍 RouteLLM API:开发者通过一个接口接入新模型,系统按任务选择更合适的模型,也可以依据成本偏好手动取舍,并混合使用开放与闭源模型。她还称该接口可用于 Claude 或 Codex 工作流,并由平台处理提示缓存。

这代表模型选择正在从应用中的硬编码决策转向独立路由层:团队可以把任务匹配、成本控制和模型更新集中处理,减少逐个适配供应商的工作。不过这些能力来自厂商自述,帖子没有给出支持的模型清单、路由评测、价格、延迟或缓存命中率,实际收益仍需用自身任务集验证。

8@dr_cintas产品介绍/未附链接

@dr_cintas 介绍了一款免费的 Language Model Builder:第一部分是约 90 分钟的交互式教材,覆盖分词、嵌入、注意力、Transformer、训练数据、损失与梯度下降、微调等基础;第二部分是在苹果 MLX 上本地运行的训练工作台,可选择数据集预训练基础模型,再做 SFT 和 DPO,对照实时损失曲线,并用 token 概率视图与成品模型对话。作者称默认设置约一天能生成连贯的多段文本,高端 Mac 训练 GPT-2 small 级别模型约需一周,产品免费、无需账户且完全离线。候选推文没有附产品链接,也未给出 Mac 型号、数据规模、默认参数、质量评测或能耗,因此时间与输出质量只能视为作者转述,不能外推到所有设备。

9@bindureddy行业从业者转述/关键数字未核实

Bindu Reddy 将 Qwen3.8-Max 描述为新的开放模型领先者,并声称其规模为 2.4T 参数、能力达到或超过 Sonnet 级别、将在本周开源;她同时列出 API 价格:输入每百万 token 2 美元、输出 6 美元、隐式缓存 0.25 美元。同批 Alibaba Cloud 官方帖子只确认 Qwen3.8-Max 已亮相,并把编码、推理、研究、写作与 AI Agent 列为用途,没有在帖文中给出参数量、开源时间、基准或价格。因此模型存在与产品定位有官方信号,但「开放模型第一」「Sonnet 级以上」、2.4T 规模、开源时间和定价仍是该作者的二手说法,必须等官方博客、模型卡或价格页确认,不能当成已落地事实。

10@alibaba_cloud官方产品发布

Alibaba Cloud 官方账号发布 Qwen3.8-Max,并把它定位为持续在线的工作搭档,列出的五类任务是编码、推理、研究、写作与 AI Agent,同时邀请用户通过产品和 API 试用。这个官方信号能确认模型已经进入公开发布传播阶段,也能确认厂商希望以通用工作流和 Agent 能力来定义它,而非只强调聊天。帖文本身没有提供模型规模、上下文长度、基准成绩、价格、开放权重计划、可用地区、API 文档入口或实际任务成功率,因此不能从这条短帖判断它是否优于其他前沿模型。产品存在与官方定位置信度高,能力强弱和使用边界仍需官方博客、模型卡和独立评测补齐。

02Agent 开发、工作流与安全

8
11@elonmusk技术观点/未来预测

马斯克赞同 James Douma 将 AI 编程类比为编译器替代手写汇编的判断,并进一步预测:源代码即将变成类似汇编语言的中间层,下一步可能连源代码都消失,由 AI 直接生成高效二进制。帖子获得 13733 次点赞、1530 次转发和 311.3 万次浏览。这是关于编程抽象层的方向性判断,不是已经实现的工程结果;原帖没有给出直接生成二进制的正确性验证、可调试性、安全审计或跨平台方案,因而更适合用来提出工具链问题,而非宣告源代码已经过时。

12@rauchg公司负责人一手实践

Vercel CEO Guillermo Rauch 介绍了公司内部 Agent @𝚟:财务、沟通、文档、营销、工程和商业分析等日常工作都开始通过它完成。他称其每日交互量和 token 用量呈指数增长,但没有公开绝对数值;系统已经能按用户保存记忆、工作流与定时任务,例如周期检查 skills.sh 是否达到 100 万个 skills 并提醒他。

更关键的是组织架构。Vercel 此前由团队和个人陆续创建了数十个 Agent,入口过多;@𝚟 既是统一入口也是路由器,内部拥有子 Agent、skills 和委派能力,必要时还能把任务代理给网络上的专用 Agent。Rauch 将它类比为 Agent 世界的单体或 monorepo:默认共用一个公司级入口,少量专用 Agent 才拥有独立入口。

当前主入口在 Slack,部分子 Agent 有 Web 界面,目标是扩展到多渠道。所有使用效果均来自 Vercel 负责人一手陈述,尚无独立效率指标;但它提供了一个具体的企业 Agent 设计取舍:统一路由与权限、保留专业子 Agent,并把源代码、运行时、数据和 token 控制权留在公司内部。

13@goodside个人实测

Riley Goodside 展示了 ChatGPT Work 中 5.6 Sol Max 的一段电脑操作:系统自行安装 Blender,并搭建 1956 年 Byrne 对 Fischer 对局中 Fischer 丢后后的棋盘与棋子模型。展示图是经过多轮提示修正后的成品;作者同时给出首轮结果,明确指出马的造型粗糙、被吃掉的后悬浮,因此这不是一次提示即成,也不能仅凭成图判断任务可稳定复现。

这条实测把能力边界拆得很清楚:安装并调用桌面软件的执行链已经能够完成,但三维建模的细节质量仍依赖人工发现问题、反复提示和验收。推文提供了完整提示共享链接,不过没有给出重复运行、耗时或成本数据。

14@rauchg厂商发布

Guillermo Rauch 用两条线程展示在 Vercel Sandbox 中运行浏览器代理的分层方案。基础场景可使用 remote-agent-browser 的代理友好接口,依次执行打开网址、点击和截图;引用的发布说明称该方案不要求调用方安装 Chromium 或浏览器二进制文件,而是使用启动较快的托管云沙箱。

当需求扩大到公网浏览规模时,线程建议让 Agent 执行 vercel i kernelvercel i browserbase,分别接入 Kernel 或 Browserbase。这个设计把简单任务留在默认沙箱,把更复杂的浏览器基础设施按需安装,减少初始环境负担。信息来自 Vercel 负责人及被引用的发布帖,尚未给出冷启动时间、成功率、隔离边界、定价或大规模运行数据。

15@petergyang访谈整理

Peter Yang 根据对 Nous Research 联合创始人 Karan 的访谈,总结了使用 Hermes Agent 的六条方法。最重要的判断是,个人 Agent 的连续性主要来自对话记忆与积累的技能,而不是某个固定模型;Karan 因此可以切换模型而很少感到体验断裂。

具体做法包括:

  • /personality 在教师、简洁等响应风格间切换;
  • 让一个 Agent 执行任务,再让没有前序上下文的新 Agent 独立检查错误、薄弱假设和缺失证据,减少模型迎合用户造成的奖励投机;
  • 用 Hermes Curator 记录技能使用情况,把不活跃技能标记为陈旧,并将长期不用的技能移入可恢复归档,防止自生成技能持续堆积;
  • 保持模型可替换和本地运行能力,把记忆、技能与自改进循环作为可迁移资产。

访谈还举了用 Hermes 修改 Chao Garden 游戏内容的个人案例。以上信息是采访者对节目内容的整理,不是独立对照实验;其中关于独立评审和技能生命周期管理的两条方法,可以直接转化为 Agent 工作流检查项。

16@vista8开发者发布

向阳乔木称,他与几位 AI 创业者交流后,认为传统 SEO 仍是较稳定的流量来源,并把多个主流 SEO Skill 与 Google 2026 白皮书资料整合成开源的 qiaomu-seo Skill。开发者可用 npx skills add joeseesun/qiaomu-seo 安装,再让兼容 Agent 对网站执行 SEO 工作。

仓库说明显示,这不是只检查标题长度或关键词密度的打分器,而是沿完整搜索链路覆盖爬虫访问、JavaScript 渲染、可索引性、canonical 与 hreflang、搜索意图、内链架构和效果测量;同时支持自然流量下降诊断、迁移检查、技术修复以及 Google、Bing 与 AI Search 的可见性边界。抓取时仓库显示 111 个星标、11 个 fork 和 2 次提交。关于传统 SEO 最稳定的判断来自作者与朋友的交流,不是渠道归因数据;仓库列出的能力也仍需用真实站点和 Search Console 结果验证。

17@vikingmute开源项目解读/官方仓库

@vikingmute 介绍 Cloudflare 新开的 Computer 项目:它把权威文件状态放在 Durable Object 的 SQLite 中,通过统一的 workspace.runtime.exec 接口选择执行后端。链接仓库确认目前有三类后端:Container 以 FUSE 把状态挂进具备完整 Linux 与网络的沙箱;Isolate Shell 在 Dynamic Worker 中运行 just-bash,直接通过 Workers RPC 访问工作区;Isolate JavaScript 则在隔离 Worker 中执行 ECMAScript 模块,并提供工作区支持的文件接口。一个工作区可登记多个后端并按任务切换,这为每个 Agent 保留持久文件、同时按成本和能力选择运行环境提供了明确架构。仓库也明确标注项目仅为预览,API 不稳定、不适合生产,因此现阶段应视为实验性基础设施,而非成熟托管承诺。

18@levelsio个人实测/开发复盘

@levelsio 复盘一个由 Claude Code 辅助开发的个人卡路里追踪器:起因是 Claude Chat 使用约一周后难以持续记住饮食数据,他把记录导出为 CSV,交给 VPS 上的 Claude Code 做成 Caltrack,并加入 Telegram Bot,便于随手记录和在服务器端做更深入查询。作者称自己约一个月保持每天 500 千卡缺口,蛋白质目标从 150 克调整到 180 克,体重以每周约 500 克的速度下降,同时举重表现没有降低;目标是 80 公斤、体脂 10% 至 15%。这些结果是单人自报,饮食、训练和应用同时变化,无法证明减脂由软件造成,帖子中的健康解释也不能替代医疗建议。真正可复用的是产品设计:把聊天短期记忆迁到持久数据层,再用 Bot 与服务器 Agent 组合成低摩擦记录和分析入口。

03商业、组织与治理

12
19@Gorden_Sun个人实测/退款个案

Gorden Sun 记录了一次 OpenAI 账号被封后的 Google Play 订阅退款经历,称退款按剩余订阅天数折算。其操作顺序是:先通过 OpenAI 封禁邮件申诉并保存拒绝处理的回复,再向 Google Play 申请退款;若自动退款也被拒,收集封号通知、OpenAI 回复和 Google Play 拒绝通知,转交 Google Play 中文客服申请「礼貌性退款」。作者称自己的申请成功,但也明确表示他人不一定能成功。引用帖只说他怀疑封号可能与 sub2api 有关,平台并未确认这一因果关系。

20@yangyi投资观点/周期判断

Yangyi 提出一套偏激但具体的 AI 应用投资判断:纯软件应用的互联网上下文已被巨头掌握,下一批新场景要等待世界模型,并依赖深圳的硬件供应链连接物理世界。他用移动互联网周期作类比,将技术变革拆成底层突破、基础设施建设、旧场景迁移、新场景创新和内容竞争几个阶段;据此认为当前应用成熟度仍不足,过早固化产品容易形成技术债。

在投资选择上,他更倾向模型与基础设施、AI 流量直接变现、ToB 服务,以及能适应底层快速变化的高抽象应用,而不是押注尚未成熟的通用应用层。帖子只有 17 次点赞和 60 条回复,没有投资组合、市场规模或项目结果支撑,因此应把它读作个人周期论与选址主张,而非深圳必然跑出下一代 AI 产品的结论。

21@xicilion用户痛点/个人观察

响马说自己开始逐步取关用 AI 发布主帖的账号:评论区偶尔使用 AI 尚可容忍,但大量 AI 文本占据时间线会让阅读体验变差,他认为这种追求流量的起号方式既辜负已有粉丝,也损害账号质感。帖子获得 142 次点赞、7 次转发、91 条回复和 27138 次浏览。这是一位用户的第一人称反馈,不代表整体受众;它给内容运营的实际提醒是,AI 可以辅助生产,但主帖仍需人的取舍、事实核查和独特经验,否则效率提升可能换来信任流失。

22@chunxiangai产品经验观点

赵纯想提出一条移动应用变现经验:把 Onboarding 拉长到 25 步以上,随后设置硬付费墙。他认为,做过 10 个以上 App 的开发者更可能认同这种设计,只是通常不会公开分享。

这条推文给出了清晰、可测试的产品假设:更长的引导流程可能先让用户投入时间、完成自我画像并建立预期,再由不可绕过的付费墙承接转化。不过,作者没有披露具体 App、样本量、转化率、退款率或留存数据,也没有比较短流程与软付费墙。它适合作为 A/B 测试起点,不足以证明所有品类都应照搬;高承诺引导也可能提高中途流失。

23@simonw个人观察与具名官方转述

Simon Willison 先描述自己在一家夏威夷餐厅听到一批过分通用的海滩主题歌曲,Shazam 无法识别,于是将其判断为 AI 内容。随后他援引一则报道:夏威夷州交通部门发言人 Shelly Kunishige 表示,檀香山机场已经开始轮播 17 首岛屿主题的 AI 生成歌曲。

两段材料不能自动等同:餐厅里无法识别的歌曲未被证明就是机场的 17 首歌,Shazam 识别失败也不能单独证明音乐由 AI 生成。更可靠的信号是,一名具名官方发言人被引述确认公共交通场所采用了一整套 AI 音乐;这把生成内容的质量、署名和公共空间使用边界,从线上争论推进到实际运营场景。

24@paulg观点

Paul Graham 提出一个产品优先的创业判断:多数成功创业公司的共同点,不是创始人每一步都做对,而是拥有一个深受用户欢迎的产品。产品若没有达到这个强度,团队几乎没有犯错空间;反过来,强需求、增长和用户黏性可以帮助公司消化运营与管理失误。

帖子在采集时获得约 2715 个赞和 168 次转发,说明这一判断传播较广,但它仍是经验性观点,没有给出具体公司、收入、留存或复购数据。对早期团队的实际启示是,流程优化不能替代需求强度验证,应先用留存、复购与自发推荐判断产品是否真的受欢迎。

25@paulg观点

Paul Graham 提醒创业公司,大企业客户的危险不一定是直接拒绝,而是先安排数月会议。创业者通常厌恶会议,因而容易把对方持续参会误读为采购承诺;但对大公司来说,会议本身可能只是日常流程,并不意味着预算、采购或上线会发生。

帖子在采集时获得约 2014 个赞和 87 次转发,但没有附具体成交样本。可操作的判断是把兴趣与承诺分开:只有明确的内部负责人、预算、试点范围、采购节点或截止日期,才比会议次数更接近真实销售进展。这一方法是从作者观点推导的执行检查项,并非帖子报告的实验结果。

26@yangyi匿名转述/观点

Yangyi 引用一则据称来自字节员工的匿名爆料:群聊中的人普遍表示已经用 AI 加快写方案、写代码和数据分析,但没有人因此提前下班;原本一天完成的工作可能半天做完,随后继续接收新任务。引用帖据此提出,企业会同步提高产出预期,使 AI 从节省劳动时间的工具变成扩大单位时间产能的杠杆。

这个机制解释了为什么个人效率提升不必然转化为更短工时,也提示团队应同时观察交付量、质量、返工和工作负荷,而不能只统计工具采用率。证据仅是一则匿名二手转述,不是员工调查或工时数据,因此只能作为组织行为假设,不能外推为字节或整个行业的确定事实。

27@paulg创业者一手观察/观点

Paul Graham 描述了自己处理可疑 AI 邮件的真实反应:一旦邮件看起来像由 AI 写成,他会先把内容粘贴到 Pangram 检测自己是否判断正确,而不是继续阅读邮件本身。这个行为揭示了 AI 内容在商务沟通中的反作用——当语言风格触发「机器代写」怀疑时,收件人的注意力会从信息价值转向真实性审查,发件人可能在内容被理解前就失去信任。证据只是一位高知名度收件人的个人习惯,不能证明 Pangram 的检测准确率,也不能代表所有客户或投资人;但它是一条具体的一手使用者信号,可用于提醒销售邮件和创始人外联不要让模板化表达盖过真实意图。

28@levelsio创业者观点/引用观点

@levelsio 转述 @yongfook 的判断:ChatGPT 或 Claude 切换到新模型时,训练方式与训练数据可能变化,企业名称在回答中的出现频率也可能随之变化,进而影响来自 AI 助手的流量。他进一步区分了两条路径:调用网页搜索工具的回答更依赖当前索引,受模型参数变化的影响相对小;直接从训练数据生成的回答则可能随底座更换而漂移。这解释了企业为何尝试通过外部提及增加进入训练语料的机会。该帖没有提供跨模型前后的品牌提及监测、流量归因或训练数据证据,因此这是有机制解释的行业假设,不是已验证因果。实际操作应把传统搜索可见性与模型记忆提及分开监控,并在模型换代后重新测量。

29@levelsio付费客户一手体验/观点

@levelsio 说,自己每月支付高额费用的会计师用一段完全像 AI 生成的内容回复问题;答案本身有帮助,却让他立即产生「既然专业人士也只是把问题交给 AI,为何不直接替换服务商」的疑问。他据此提出相反的服务策略:会计等高风险专业服务既然已经收取高价,更应该把人工判断、责任承担和 human-in-the-loop 明确作为溢价组成,而不是向客户暴露无差别的 AI 转述。这个案例是单个付费客户的主观观察,帖子没有证明会计师确实直接转发模型答案,也没有比较准确率、响应时间或服务成本,因此不能推断整个行业。但它清楚呈现了 AI 商品化后专业服务的价值感知风险:效率提升若没有被包装成更可靠的结果,反而可能促使客户重新评估订阅。

30@lennysan访谈提要

Lenny Rachitsky 发布了一期产品管理访谈的提要,嘉宾 Tom Verrilli 现任 Whatnot 首席产品官,过去曾在 Twitch 和 Twitter 负责产品。节目把 AI 对产品组织的影响拆成五个判断:AI 正在暴露大量只做流程表演的产品工作;系统思维是上升最快的 PM 能力;AI 对 PM 的最大增益已从原型制作转向数据科学;组织不应把一线表现最强的人持续晋升到脱离擅长工作的岗位;单靠招聘优秀人才后完全放手并不可行。

这些内容来自节目预告而非论证全文,推文没有展开案例、数据或具体管理机制。因此它适合作为产品组织议题的索引,不能把五个结论当作已由节目证实的普遍规律。

每日产品 Top 10

#产品一句话热度
1AgentSky为开发者托管 Claude Code、Codex 等长时 Agent,并支持多端继续交互。361 · 💬39
2Ctruh Studio让设计师和品牌团队在浏览器里无代码制作并发布互动 3D 与 XR 体验。328 · 💬79
3Airtop for Google Ads Automation用自然语言创建、监控和优化 Google Ads,并自动整理投放报告。247 · 💬19
4Plethora把小游戏、谜题和互动艺术装进可直接操作的内容信息流。171 · 💬7
5Appllama供移动产品与增长团队检索高收入 iOS 应用的完整界面流程和商业数据。167 · 💬12
6yapyap在用户电脑上完成会议录音、转写、说话人区分、摘要和行动项整理。136 · 💬1
7Snapdown把 Mac 屏幕任意区域在本机转换成保留标题、列表和表格的 Markdown。127 · 💬11
8claudemon把等待 Claude Code 的时间变成终端里的经典角色捕捉小游戏。125 · 💬12
9Hand Wave借智能眼镜摄像头把手语实时转换为文字和语音,帮助面对面沟通。123 · 💬3
10PassiveShorts为无真人出镜账号自动生成脚本、配音、字幕并排程发布短视频。105 · 💬6

扩展阅读

01安全、隐私与权限

3

02开放模型与本地推理

18

03科学、政策与社会

7

04Agent 与开发工具补充

9

05商业与边缘信号

2

今日保留 103 个唯一信息源 · 已全部浏览

小四每日精选 - AI 科技日报 | AI陪我笨拙前行