资讯同步's avatar
资讯同步
npub195q4...wpxu
资讯同步's avatar
资讯同步 48 mins ago
#InfoQ推荐 ![](https://static001.infoq.cn/resource/image/80/da/80f84cb9db9408ca07e43cc5575c5bda.jpg) 在 Azure 最近的一篇架构博文中,Azure 首席工程师 Kishorekumar Pattabiraman 概述了在构建 AI 系统时,[在技能、子代理和其他方法之间进行选择的实用标准](https://techcommunity.microsoft.com/blog/azurearchitectureblog/skill-or-sub-agent-choosing-ai-capabilities-you-will-actually-reuse/4542099)",并强调了可复用性、简洁性和长期可维护性。 据 Pattabiraman 介绍,团队往往从错误的问题入手,只关注应该使用哪种模型。然而,“第一个真正的抉择”并非模型,而是架构: > 你是在构建技能还是子代理?如果搞错了,无论选择哪种模型都无济于事。技能和子代理是两种不同的实现形式,各自都无法胜任对方的任务。 技能在持续进行的对话中运行:它可以读取文件、提出问题、与用户进行交互,并在整个过程中让用户始终参与其中。相比之下,子代理则接收单个提示词,独立运行直至完成,并输出最终结果。Pattabiraman 指出,两者各有其适用的场景,具体使用哪个取决于任务的性质。 为了决定是构建技能还是子代理,Pattabiraman 强调了四个需要考虑的关键维度:迭代模型、语音保真度、人工干预点以及任务的重复频率。 ![](https://static001.geekbang.org/infoq/ef/ef2189d62242e96ee828cd6ce4f2065d.png) 在这四个维度中,频率是界限最为分明的区分因素:“一次性手工制品更倾向于技能,而可重复的批量工作则更倾向于子代理”。其他因素则需要更审慎的考量。例如,人们很少是在“完全交互式的对话”与“简单的任务交接”之间进行选择,因此需要进行两方面的权衡:一方面是让人类参与基于技能的迭代流程所产生的成本,另一方面是强行将同一流程压缩为“一次性响应”(这种响应可能每次都需要修正)所带来的风险。针对每个维度,Pattabiraman 都概述了关键的权衡取舍以及应避免的常见陷阱。 关于何时使用技能(skill)而非子代理(sub-agent)的问题,在 Reddit 和 Hacker News 上也有人对此展开了讨论。一位名为 enthusiast\_bob 的评论者指出,[子代理始终从一个干净、无污染的上下文窗口开始,而技能则始终会考虑整个对话内容](https://www.reddit.com/r/ClaudeAI/comments/1oawwlw/comment/ny5v84c/)"。另一位用户 dan-does-ai 则强调了[不同的权衡](https://www.reddit.com/r/copilotstudio/comments/1v3owec/comment/ozbojn1/)":技能“可以在多个代理或对话流中复用”,而“子代理在以下情况下才有意义:该步骤确实需要独立的上下文、权限或不同的知识来源”。 另一个重要的考量是使用子代理时产生的协调需求。除了增加复杂性外,还必须考虑协调层带来的非确定性。例如,Reddit 评论者 Ashlesha-msft 指出,[在 Copilot Studio 中](https://www.reddit.com/r/copilotstudio/comments/1v3owec/comment/oz8e6q5/)": > 规划器会根据描述、上下文和最近的对话记录,动态决定何时调用技能、工具、主题或子代理。正因如此,并不是每个类似的提示词都会调用某项技能。 作为社区提供的最后一个视角,[用户 Vlourenco69 提出了一个简单的思维模型](https://www.reddit.com/r/vibecoding/comments/1qur9xt/ai_agents_subagents_skills_mcp_and_a_parallel/)",用于“理解 AI 代理、子代理、技能、MCP 等概念”:其中,代理扮演导演的角色,子代理扮演经理的角色,技能扮演专业工作人员的角色,工具扮演专用机器的角色,而 MCP 则代表组织的治理规则或策略。 让讨论回到原点,Pattabiraman 指出,在许多情况下,技能与子代理的二分法仅是表面现象。实际上,这两种模型可以无缝组合,当问题需要时,技能可以构建在子代理之上。在许多情况下,这种分层方法代表了最成熟的设计。 原文链接:<https://www.infoq.com/news/2026/08/choosing-between-subagent-skills/>"
资讯同步's avatar
资讯同步 49 mins ago
#华尔街见闻 8月4日AMD史上最好财报公布后,股价却重挫9%。对此AMD CEO Lisa Su强调,AI算力正全面爆发。 AMD处核心位置,整体计算市场2030年将超2万亿美元,数据中心业务2027年增长超100%;CPU需求同步激增。 企业应大胆投入AI,同时严格管理成本,短期波动不影响长期趋势。
资讯同步's avatar
资讯同步 49 mins ago
#华尔街见闻 华盛顿接连释放的政策信号,正推动全球债券和外汇投资者重燃"卖出美国"的讨论。**美联储主席的沟通风格转变、财政部介入外汇市场,叠加财政赤字扩张与贸易战阴云,令市场对美国资产的信心出现新一轮动摇。** 最新动态显示,美联储主席沃什倾向于减少政策沟通,引发市场对美联储抗通胀承诺的疑虑。与此同时,据《华尔街日报》报道,特朗普自沃什就任以来已多次与其通话,打破近年惯例——尽管目前没有证据表明双方讨论了利率问题。财政部长贝森特则签署批准美国协助日本干预汇市,支撑日元,此举是近三十年来首次此类协调行动,进一步压制美元走势。 上述双重冲击已在市场价格中有所体现。30年期美债收益率升破5%,创2007年以来新高,尽管此后有所回落;彭博美元即期指数自6月高点以来累计下跌约2%,美元兑几乎所有十国集团货币均告走软——这一走势与美国利率仍处高位的背景形成异常背离。 Gama Asset Management全球宏观组合经理Rajeev De Mello表示,正是由于政策不确定性,他正在卖出美债和美元,"**贝森特和沃什对全球市场是双重打击,投资者不得不将其政策风险计入美元和美债曲线之中——这就是特朗普政府溢价。**" ## "卖出美国"再度浮现,但与去年有所不同 "卖出美国"交易最初于去年4月引发关注,彼时特朗普宣布关税措施,触发美元、美股和美债同步抛售。尽管那轮行情迅速平息,但它动摇了市场长期以来的假设——即美国可以凭借美元储备货币地位和深厚资本市场,无限期为不断扩大的财政赤字融资。 此番情形更为复杂。美股方面,科技股强势推动标普500指数再创历史新高,市场并未出现全面崩盘。外国投资者持有的美债规模截至5月已达9.4万亿美元,较一年前增长4%,显示整体信心尚存。 然而,债券和外汇市场的部分全球投资者正在调整立场。 Brandywine Global Investment Management新加坡基金经理Carol Lye表示,该公司持有中期看空美元仓位,**"贝森特如今也跳出来表示日元应该走强,这将印证我们的弱美元判断。"她还指出,华盛顿释放的"混乱信息"不利于资金流入美国。** ## 美联储公信力存疑,长端美债压力上升 市场担忧的核心之一,是美联储能否在沃什领导下有效锚定通胀预期。**分析人士认为,一旦美联储落后于加息周期,长端收益率将面临进一步上行压力。** 彭博经济研究数据显示,30年期美债期限溢价——即投资者持有长期债券所要求的额外回报——本周升至1.56%,为2013年以来最高水平。安联环球投资(管理资产规模5980亿欧元)目前偏好收益率曲线陡峭化交易,重点布局五年期至七年期对抗30年期债券。 该公司高级组合经理Ranjiv Mann表示**,"风险在于美联储可能在加息周期中落后于曲线,长端收益率有可能变得更加失锚,而美国面临的财政挑战本已十分严峻。"**与此同时,财政部本周将当季借款预期上调至7390亿美元,市场普遍预计当局将延续以短期国库券为主的发行策略,供给压力持续累积。 ## 日元干预引发美元前景争议 美国协助干预外汇市场的举动,在投资者中引发了对美元结构性走势的重新审视。 贝森特在接受CNBC采访时为此举辩护,称日元持续疲软可能引发亚洲货币更广泛的贬值,华盛顿将"不惜一切"以有利于美国经济、稳定全球市场的方式支持日本。 本次干预通过买入欧元、卖出美元换购日元的方式实施,旨在避免直接冲击美债市场。贝森特将此描述为"储备的重新配置"。**然而,市场人士提醒,若日本——美国最大海外美债持有国,持仓逾1万亿美元——被迫出售部分美债以筹措干预资金,波及效应仍可能传导至美债市场。** 渣打集团财富管理部门全球首席投资官Steve Brice预计,美元未来12个月将下跌约3%至4%,"政府行动及其他因素正在逐步侵蚀美国市场的结构性优势。" ## "美国例外论"未终结,但隐患不容忽视 多位策略师强调,目前没有人预言美元的全球储备货币地位将终结,或美债将失去全球基准无风险资产的地位。 太平洋投资管理公司多资产信用策略师Lotfi Karoui在一份研究报告中指出,美国资产对外国买家整体仍具吸引力,缺乏大规模联动抛售便是佐证。今年以来,仅约2%的交易日出现了10年期美债、美国投资级企业债利差和美元同步下跌的情形,"若对美国例外论真正失去信心,这类联动抛售应出现得更为频繁。" 但Lazard首席市场策略师Ronald Temple指出,核心隐患在于,**外国资金买入美债的速度已赶不上美国举债扩张的速度。**他在接受彭博电视采访时表示,"围绕美国安全资产地位的信心背景正在发生改变,存在大量疑问。未来数年,美元贬值走势将重新浮现。" 风险提示及免责条款 市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
资讯同步's avatar
资讯同步 49 mins ago
#华尔街见闻 OpenAI正式要求联邦法官驳回苹果公司提起的商业秘密盗窃诉讼,双方围绕AI人才争夺的法律对决持续升温。 据彭博报道,OpenAI在周三晚间提交的法庭文件中,**将苹果的诉状斥为"缺乏充分调查、断章取义",并援引苹果自身的措辞称其诉状"烂透了核心"(rotten to its core)。**OpenAI同时指出,苹果不应被允许以"毫无根据、借口连篇的诉讼"来弥补其在人才市场上的竞争短板。 此次申请驳回诉讼,是对苹果今年7月起诉OpenAI及其首席硬件官Tang Tan的正式回应。两家公司此前曾合作长达两年,将ChatGPT直接整合进iPhone、iPad及Mac软件,但近期关系已明显降温。 ## OpenAI:员工行为合法,诉状歪曲事实 OpenAI的律师团队在文件中强调,苹果的诉状对公司员工行为存在严重失实描述。**文件称,ChatGPT制造商的顶级硬件高管在面试苹果员工时,完全符合行业通行的招聘标准;而被指控盗窃商业秘密的员工,实际上是在应苹果方面的请求,协助前同事确保相关工作在其离职后能够延续。** OpenAI在文件中表示,该诉讼"将前员工善意、合法的行为——在许多被引用的案例中,他们实际上是在应苹果要求帮助苹果——重新定性为所谓商业秘密的盗窃"。 ## 苹果指控:OpenAI蓄意策划人才渗透 苹果今年7月提起诉讼,指控OpenAI通过招募和雇用苹果员工,蓄意策划了一场窃取商业秘密的行动,被点名的被告包括OpenAI首席硬件官Tang Tan。 两家公司此前的合作关系颇为深入。在长达两年的合作期间,双方共同推进了将ChatGPT嵌入苹果核心软件生态的整合项目。然而随着合作关系趋于冷淡,双方的竞争摩擦逐渐浮出水面,并最终演变为法律纠纷。 ## AI人才争夺战的法律折射 OpenAI在申请驳回诉讼的文件中,还就苹果在AI产品整合方面的不足提出批评,暗示苹果此次诉讼动机存疑。OpenAI表示,苹果不应借助法律手段来弥补其在AI人才竞争中的劣势。 此案折射出科技巨头与AI初创公司之间在顶尖人才争夺上的激烈博弈。随着AI能力成为各大科技平台核心竞争力,围绕人才流动与知识产权归属的法律争议预计将持续增多。目前,联邦法官尚未就OpenAI的驳回申请作出裁决。 风险提示及免责条款 市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
资讯同步's avatar
资讯同步 49 mins ago
#V2EX ### [分享创造] 我发明了一个情趣用品,男的用的电动的,上半身的,怎么才能在国内销售呢,直接咸鱼卖有法律风险吗 我最近闲来无事,做了一个小玩具,目前比较粗糙有个小马达上面加了羽毛,目前我是手持感受的,发现勉强能用,主要是力度稍微有些大,手持得话没办法解放另一只手。 我正在研究如何做成吸附的方式,并且尝试调整震动强度和频率。 我搜了一下国内如何合规,这类带电动功能的审批比较严格,要各种资质。请问有做类似产品的朋友吗,这种可以在闲鱼卖吗,如何才能规避风险。
资讯同步's avatar
资讯同步 49 mins ago
#V2EX ### [信息安全] 想装 antigravity 结果执行了木马程序 由于我的 codex 额度快用光了,想到自己之前开的 google pro 会员还没到期,就打算下载 antigravity 薅下 opus 的额度。 google 搜索后点击进入了 <https://sites.google.com> 这个网站,因为是谷歌的域名我就直接复制并执行了所谓的安装命令,执行后让我输入电脑的管理员密码我也输入了,后续还要申请读取文稿之类的权限,我觉得有点奇怪就看了眼 bash 命令,发现后半部分是一串 base64 ,瞬间鸡皮疙瘩起来了。 后续就是让 codex 排查,确定了是恶意程序,目前在让 codex 尝试反编译恶意程序二进制文件,定位影响范围。 哎,真糟心,几个月前看到过 <https://www.v2ex.com/t/1212003> 这个哥们的帖子,没想到我也中招了 <https://imgur.com/a/sqxSz5c>
资讯同步's avatar
资讯同步 49 mins ago
#V2EX ### [分享创造] 我开发游戏终于上线啦,肉鸽卡片,欢迎大家品尝 <https://store.steampowered.com/app/3570110/Summoners_Gambit/> <https://www.bilibili.com/video/BV13CgS6WEpD/> 停牌,还是继续? 游戏的博弈感源于经典的 21 点规则。多抽一张,可能逆转战局,也可能满盘皆输。不同于传统扑克,《神之一手》中的每一张牌都是一次实体召唤。但若玩家因贪婪导致「爆牌」,溢出的能量便会反噬自身,招致来自古神的毁灭性打击。在稳健运营与孤注一掷之间,《神之一手》将牌桌上的心理较量与战场上的排兵布阵完美结合。 欢迎大家来品尝
资讯同步's avatar
资讯同步 54 mins ago
#财新 > 通过与欧美顶级青训的直接对话,中国足球可以思考在训练环节、战术理念、球员培养模式上存在的结构性差距,也能检验自身的进步   “国足”有这样一支球队——   今年5月,他们在亚洲杯小组赛前两场接连不敌印度尼西亚和日本,一度跌至小组垫底,但随后一路逆袭,先后击败卡塔尔、沙特、澳大利亚,闯入决赛,最终2比3憾负日本,获得亚军——而时隔22年重返亚洲杯决赛,时隔21年拿到世少赛入场券,已经是近年来中国足球最为励志的桥段。   今年8月,他们在上海明日之星冠军杯A组中3:2绝杀阿森纳青训梯队、1:0击败毕尔巴鄂竞技青训梯队,不但两战两胜提前锁定四强,还以强硬且热血的画面,打破了外界对国产青训球员的固有认知——在和欧洲青训名门的同年龄段对抗中,中国人不再只是学习经验的一方。
资讯同步's avatar
资讯同步 1 hour ago
#InfoQ推荐 ![](https://static001.infoq.cn/resource/image/aa/1b/aa0102b68a277c73b235bebcd65dcb1b.png) 一年前,Google 首席科学家 Jeff Dean 在 AI Ascent 2025 峰会上预测:到 2026 年,可能出现能够全天候工作、能力接近初级软件工程师的 AI 系统。 一年后,也就是 6 天前,他在一期 YC 访谈中承认,自己低估了 AI 的进展速度。模型处理复杂任务的能力,增长得远比他当时预想的更快。那么,在 Jeff Dean 看来,AI 接下来还会以多快的速度向前推进?创业公司又该如何在通用模型不断扩张能力边界的时代生存下来? 今天凌晨,这期访谈又有了不同的分量。Jeff Dean 宣布,明天将是自己在 Google 的最后一天。效力 Google 27 年后,这位被誉为硅谷“程序员中的程序员”、深度参与 Google 系统架构和 AI 技术建设的传奇工程师,将与长期合作伙伴 Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 共同创立 Discovery Loop,一家聚焦机器学习、科学和工程前沿研究的公益性公司。Google 将作为创始投资方和云计算合作伙伴继续与他们合作。 据 WIRED 披露,这个创业想法其实只是几周前才浮出水面。为了挽留这支核心团队,Alphabet CEO Sundar Pichai 还曾在多次会面中试图说服他们“别摘工牌”。但最终,几人还是决定离开大公司体系,去换取一家初创公司才有的乐趣、速度和自由。 ![](https://static001.geekbang.org/infoq/bb/bb2c424701fa4865cd59c4596416bfad.png) ![](https://static001.geekbang.org/infoq/d1/d1046e3ce7055684f6e9f83e88e01994.png) 截图来自:<https://x.com/JeffDean/status/2085035498222002595/photo/1>" Jeff Dean 在告别信中写道,自己见证了 Google 从一家只有 25 人的公司,成长为拥有 19 万多名员工的科技巨头。如今,Google 已有 13 款产品的用户规模超过 10 亿。从搜索、邮件、翻译和视频,到大规模计算、自动驾驶和 AI 系统,他参与建设的技术几乎贯穿了 Google 的整个发展历程。 而促使他们离开的一个重要原因,也恰恰是大公司难以摆脱的惯性。正如 Oriol Vinyals 所说,在大型组织内部,要推动任何激进变化,都必须先克服层层阻力;他们想做点不一样的东西。颇有意思的是,迄今为止,这家新公司甚至还没来得及招人、租办公室,至于谁来当 CEO,团队内部短暂停顿后,大家把目光投向了 Jeff Dean——“我想应该是我吧。”他说。 ![](https://static001.geekbang.org/infoq/44/4438d334bd33f2689bb85297f86aa9d8.png) ![](https://static001.geekbang.org/infoq/72/72d1d05caa3feaacfe3a04b7e24376d3.png) 因此,这期发布于 Jeff Dean 离职前夕的访谈,也像是他站在职业生涯转折点上,对 AI 下一阶段的一次集中判断。节目中,他与 YC 合伙人 Diana Hu 讨论了 AI 从“模型为中心”转向“上下文工程”的范式变化、推理硬件正在出现的巨大机会,以及创业者如何在通用模型越来越强、越来越多应用可能被模型直接吞并的时代,找到真正值得坚守的生存空间。 本文基于该访谈视频整理,经 InfoQ 编辑。 太长不看版 Q:去年你说到2026年会出现能力接近初级工程师的 AI。一年过去了,这个预测打脸了吗? A:相当准确,但我低估了一件事:模型处理越来越复杂任务的能力,增长速度比我预想的快得多。而且这种能力正在溢出到编码之外的领域,基于Agent的系统开始真正崭露头角。 Q:对2027 年的大胆预测是什么? A:深度学习系统将实现全自动的问题分解和自动化实验循环:把问题拆成子问题,自动跑实验,整合结果,得到一个改进后的系统。而且这不只适用于机器学习,任何有可衡量目标的科学和工程领域都能用上。 Q:2001 年 Google 把搜索索引装进内存,2026 年那个“装进内存”的时刻是什么? A:高性能、低能耗的专用推理硬件。推理是让Agent系统触达更多人的关键,专用硬件能带来 50 倍延迟改善和 30-80 倍能效提升。当年省掉的是磁盘寻址的物理延迟,今天省掉的是通用计算的多余步骤。但这次赌注更高,因为Agent需要的是成千上万次连续推理,每一次延迟都在累积。 Q:人们现在对 AI 最大的误解是什么? A:大家都觉得Agent就是跑一两个小时的临时任务,但配合足够强的底层模型,你可以让Agent连续跑上几天甚至几周。 Q:那张催生 TPU 的餐巾纸数学,到底算出了什么? A:2013 年语音识别效果暴增,我们算了笔账:如果每个用户每天对着手机说三分钟话,用 CPU 根本撑不住,于是造了 TPU。几年后 Transformer 横空出世时,它恰好成了根基。 Q:AI 时代的延迟数字清单,最该记住哪个数? A:做一次计算消耗约一皮焦耳,但把数据搬进处理器的那一小段路,能耗是它的 1000 倍。这个差距决定了你必须做 batching,把很多样本拼在一起处理,把成本摊成“一千倍除以 batch size”。 Q:创始人该怎么选要做的领域? A:拿当前最强的通用模型去测你想做的领域,如果模型成功率在 0% 或 1%,那是好信号;如果在 20%,那是危险信号,说明能力已经萌芽,下一代模型很快会覆盖。 Q:当 Agent 写完所有代码,什么技能变得稀缺? A:品味,知道该让你的 Agent 去解决什么问题。一是靠解决过大量问题的经验,二是写下你觉得未来 12 个月可能重要的十件事,一年后回来复盘哪些真的变重要了,三是做疯狂的思想实验,比如“如果晶体管每天出错 20 次而不是每一百万年一次,系统该怎么设计?” ## 高性能、低能耗的推理硬件革命 Diana:去年5月在AI Ascent大会上,你说到2026年左右,可能会出现能够全天候工作、能力接近初级工程师的 AI 系统,现在我们离这个预测有多近? Jeff:我觉得模型在处理基于Agent的长时间运行编码任务方面进步非常大。现在看起来很明显,它们确实已经相当有能力了,取决于你对“初级工程师”的精确定义,这个预测现在看来相当准确。 Diana:那你当时低估了什么? Jeff:我认为处理越来越复杂任务的能力,其增长速度比我预想的要快得多。而且,在编码之外的领域,这些基于Agent的系统也开始真正崭露头角,我认为这将是未来一个重要的趋势。 Diana:你觉得2027年版的预测会是什么? Jeff:我认为你会看到更多机器学习系统自身的自动化。具体来说,就是让机器学习系统通过运行大量实验来提升自己的能力,把问题分解成子问题,在紧密的自动实验循环中运行这些子问题,然后把结果整合起来,从这种全自动的问题分解和自动化实验中得到一个改进后的系统。而且这不仅适用于机器学习,也适用于科学和工程的其他领域。基本上任何有可衡量目标的事情,如今都能取得很大进展。 Diana:2001年,Google搜索还是跑在硬盘上的。你和Sanjay算了一笔账,意识到在某个时间点,整个搜索索引终于能装进所有运行中计算机的内存里。你们做出了那个激进的决定,基本上在几天之内就和Sanjay一起把一套全新的、基于内存而非硬盘的搜索版本推到了生产环境,正是这件事让Google成为了今天的Google。 历史总是在重演,那么在2026年的当下,那个“能装进内存了”的时刻是什么?在座所有人都应该思考和设计的那个转折点在哪里? Jeff:情况有些不同,但我想说的是,你会看到越来越多高性能、低能耗的推理硬件系统出现。因为现在大家都意识到,推理是让这些Agent系统触达更多人的关键。延迟真的很重要,而硬件的专门化是让你在能效和延迟上都优于GPU或CPU这类通用计算设备的核心途径。 Diana:所以你的意思是我们也许不用再等待了? Jeff:没错,想象一下,如果延迟能改善50倍,你能做些什么? Diana:在座大约6000人,他们脑子里关于AI的哪个假设,其实已经是错的了? Jeff:我想可能是人们还没有充分意识到,Agent系统能跑多久的潜力。大家总觉得Agent就是跑一个小时、两个小时的临时任务。但事实上,在某些问题领域,配合足够强大的底层模型,你可以让这些Agent连续跑上几天甚至几周,真正去解决那些复杂的、长期的问题。这绝不仅仅是“多等一会儿”的区别,而是质变。 Diana:那你实际跑过哪些跑了几个星期的任务?你让Agent去解决什么? Jeff:比如,你可以让Agent去实现一个全新版本的软件,用不同的编程语言重写,可能具备更好的安全性或性能特性。它真的能认真地去完成这件事,而且完成得相当靠谱。 ## TPU的起源 Diana:大家一直都知道你特别擅长“餐巾纸数学”。有个关于你的故事是,2013年谷歌的语音识别刚上线时,你做了个估算:如果每个谷歌用户每天用手机对着语音识别系统说三分钟话,整个服务器的规模就得翻倍,那成本高得吓人。于是你构建了一个定制芯片,那就是TPU的起源故事。 Jeff:当时的情况是,我们训练的基于深度学习的语音模型,效果开始变得非常好,但计算开销比老的语音系统贵得多,不过它把错误率砍掉了一半。这相当于把语音识别领域20年的进步,浓缩在几个月里就实现了,我们只是调整了一下模型、稍微扩大规模、拿到更好的数据。于是我们开始担心:如果语音识别效果大幅提升,人们的使用频率也会大幅上升。 所以那个粗略计算实际上就是关于:如果人们开始更频繁地使用语音识别,用来口述邮件、对着手机说话,会发生什么?算完之后我们发现,当时用CPU跑根本撑不住,于是我们造出了TPU,一种专门为低精度稠密线性代数设计的芯片,而这正是今天几乎所有机器学习算法的核心。 虽然除了算线性代数,它啥也干不了,不能运行Chrome和Word,但这对机器学习推理来说无所谓。几年后这颗芯片问世,能效比同时代的CPU和GPU高出30到80倍,延迟也低了20到30倍。 Diana:你当时肯定没法预料到,TPU会在后来Transformer架构横空出世时变得如此根基性,毕竟Transformer是TPU发明之后好几年才出现的。 Jeff:这恰恰是我们当初把它做成一个通用线性代数系统的原因。我们知道机器学习算法还在演化,不能过度特化,但又要特化到能获得巨大的性能收益。所以我们做了很大的乘法单元、高速内存、高速互联,后来的TPU还能把成百上千颗芯片高效地协同到同一个问题上。就这样一代一代迭代,一直做到今天。 Diana:如果有谁想当未来的创始人,应该算一道什么样的“餐巾纸数学”,才能造出像TPU一样有影响力的东西? Jeff:我觉得,去想想你在思考的领域里看到了什么问题、什么瓶颈,然后问自己:有没有一种非常不同的思考方式,能让解决方案带来一个数量级甚至两个数量级的提升?有时候你只是眯着眼看一个问题,不被“这个问题今天是怎么解决的”锚定住,而是从第一性原理出发去思考你会怎么解决它,你就能冒出一些被人根本没想到的真正的好点子。 ## AI时代的“延迟数字”清单 Diana:你多年前写过一份非常著名的清单,叫《每个工程师都应该知道的延迟数字》,里面列了各种系统操作的耗时:缓存未命中要多久、磁盘寻道要多久、一个网络包从加州传到荷兰要多久……这份清单后来成了无数分布式系统工程师的圣经。现在,是时候更新AI 版的了。 Jeff:如果看今天 AI 系统里什么最重要,你首先得知道加速器上主内存到片上内存、再到乘法单元之间的带宽是多少,你得知道做一次乘法运算要消耗多少能量,你还得知道芯片之间的互联带宽是多少,以及在这个带宽下你能连多少颗芯片。再往大了说,当你需要跟 10000 颗芯片通信而不是 500 颗的时候,网络带宽会衰减到什么程度。这些数字才是真正决定你怎么思考问题的底层约束,它们直接决定了你会用什么样的思路去解决什么样的问题。 Diana:你说过,现在衡量一切的标尺变成了能量。做一次计算或数学运算大概消耗一皮焦耳,但移动数据、做数据 I/O 的能耗是它的 1000 倍。 Jeff:没错。就是从加速器上的 HBM 把数据搬进处理器、让它真正能算得上的那一小段路,能耗就差了三个数量级。 Diana:这个差距其实在悄悄决定哪些产品能做出来、哪些算法路线能走通。既然数据移动这么贵,如果创始人来找你,说自己遇到了“模型问题”,但实际上本质是能源问题或数据 I/O 问题。你怎么分辨这两者? Jeff:你刚才提到的这个一千倍差异,其实塑造了机器学习里大量的决策。如果没有这一千倍的差距,你根本不需要做 batching。但现实是你必须把很多样本、很多 token 拼在一起处理,才能摊薄数据移动的成本,不是付出一千倍的代价,而是付出“一千倍除以 batch size”的能耗。而对低延迟场景来说,batching 并不友好。所以这些硬件层面的能耗考量,深刻影响着我们构建上层系统时的每一个决策。 Diana:一个很具体的例子就是训练模型的方式,把数据集分批、跑 epoch,很多人以为这是模型问题,但实际上这本质上是个系统的数据 I/O 问题,对吧? Jeff:对,你必须组装 batch 才能让硬件跑出更高效率。理想情况下你恨不得用 batch size 等于 1 来训练,但那样效率太差了,所以现在大家都用很大的 batch。 Diana:我听说你有个习惯:消失一段时间,然后带着一个绝妙方案回来。那有没有可能你花上几周时间,把 batch size 等于 1 的训练彻底搞定? Jeff:说实话,我最近更多在想推理这件事。推理是个很有意思的问题,因为你确实想要极低延迟,训练倒不一定需要那么低的延迟,而推理恰恰是 batching 最不好使的领域。核心就是尽量把数据搬运降到最低,然后去想极低精度的运算,也许不需要支持那么多不同种类的精度格式。如果你对需要哪种精度有很好的答案,那就直接把它固化进硬件里,别的都不用管。 Diana:我想起一位著名计算机科学家跟我说过的一个核心类比:整个 AI 过程本质上是一个巨大的压缩问题。因为要让数据有损压缩、再把它恢复出来,你基本上得先真正理解它。 Jeff:对,如果你真正理解数据,就应该能把它压缩得非常好。 Diana:Transformer 架构恰恰就是被验证为特别好用的一种压缩方式。 Jeff:这得归功于我的同事们。 ## 上下文工程是下一个前沿 Diana:过去我们谈 AI 进步,往往就是指模型本身变得更好。但最近几年越来越明显的是,不只是模型规模、参数数量或数据量,而是检索、工具调用、记忆、Agent工具这些外围能力,这些东西正在汇聚成人们所说的“上下文工程”。 Jeff:模型其实只是整个系统里的一块拼图。你要做的,是构建一个能解决真正有趣问题的完整系统,这个系统需要一个知道怎么用各种工具的模型,知道怎么检索相关信息,也许还保留着过去解决类似问题时检索过的历史信息,然后把这些信息放进模型的上下文里。上下文工程的美妙之处在于,这些信息对模型来说是极其清晰的。不像训练数据那样,几万亿个 token 搅在一起,融成几千亿参数的浓汤,什么都糊在一起,模型直接看到的上下文,远比那些模糊的训练数据要明确得多。 接下来还要理解有哪些工具可用、哪些工具能帮模型解决当前这个阶段的问题、怎么把一个复杂问题拆解成一系列工具调用、甚至尝试多种路径看看哪条走得通、然后评估效果,这就是复杂Agent和多Agent系统的编排,它会变得越来越重要。 Diana:怎么才能成为上下文工程的高手? Jeff:最好的方式就是直接用这些模型、Harness和工具去解决实际问题。用着用着,你会看到模型在哪些地方失败了。然后你会发现,你往往不需要调整模型参数,那是外部很难做到的事,而是通过写更好的提示词、设计更清晰的上下文,就能让模型表现得更好。 Diana:能不能给我们举个你自己做上下文工程的例子?你写过哪些 skills,或者配过哪些工具,让你的工作流发生了巨大的变化? Jeff:就拿我和 Sanjay 几周前一起做的事来说吧,我们经常要做一些非常底层库的性能优化工作。Google 内部有一套微基准测试库,你可以用它来测量不同操作耗时多久,比如从数据结构里弹出一个元素需要多少纳秒。这些数据结构可能跑在 Google 数百万个进程上,所以确保它们的高性能其实非常重要。 我们写了一个 skill,教模型如何按特定顺序做一系列操作:先跑微基准测试测量当前性能,然后做代码修改,再重新跑基准测试验证改进效果,接着测量缓存占用,然后继续迭代。这样它就能做自我改进,实际上只是我们把作为人类会使用的方法以模型能用的形式给了它。 Diana:也就是说,你们有一个 skill,如果别人拿到了,就能像 Jeff Dean 一样做性能优化?全世界都会疯抢这个东西,对某些人来说它值无限的钱。 Jeff:其实我们几个月前发布了一份文档,叫《Performance Hints》,是 Sanjay 和我写的。那是一份大约 30 页的文档,涵盖了各种性能优化的技巧。已经有人把它做了摘要喂给各种模型,结果发现模型在推理代码性能问题上的能力确实变强了。 Diana:在座各位可能都在构建 Agent,也都见过自己的 Agent 在第 30 步或第 40 步突然跑偏。你觉得今天的瓶颈是什么?是上下文评估器,还是因为这是个开环系统、错误不断累积? Jeff:我们当然希望 Agent 能长时间运行,因为这样才能解决越来越复杂的问题。但正如你观察到的,它们有时在十次工具交互之后就不工作了。有时候是因为模型在尝试做它缺乏经验的事情,模型一旦偏离训练分布,性能就会像大多数机器学习模型一样急剧下降,离舒适区越远,失败的概率就越高。 有几种应对办法:一是给模型提供 skill 和提示,让它尽量走在熟悉的明亮路径上;二是采用多 Agent 系统,让多个 Agent 尝试不同方案,再用另一个模型或 Agent 去评估哪些方案有前景。这本质上是用推理时计算来搜索可能的解决方案空间,能大幅提升长时运行 Agent 流程的可靠性和性能。 Diana:你们内部是怎么实现这种工作流的? Jeff:我们有各种 harness,还有一整套 skill。尤其是在 Google 内部开发环境里,我们写了 skill 让 Agent 学会使用内部工具,代码审查、性能测量、拉取日志文件。这些 skill 让基础模型即使没被训练过我们专有系统的用法,也能通过正确的 skill 定义把活干好。 ## 初创公司如何打败谷歌 Diana:Google 的独特之处在于,你们从处理器到产品全栈协同设计。哪些层是 Google 会持续深耕、不断积累优势的?哪些地方是两三个人的小团队依然能打赢的? Jeff:显然 Google 和 Gemini 模型以及硬件基础设施,我们追求的是构建能做几乎所有事情的通用模型。但在很多情况下,这意味着我们无法在特定领域投入太多注意力。一个精心设计的界面,搭配一个模型和一组 skill,或者一个不在通用模型体系里的专用模型,反而可能拥有显著优势,因为你可以为真正热爱的领域打造出令人愉悦、高精度、高质量的产品,我觉得这正是两三个人做他们真正兴奋的东西时能获得优势的地方。 通用模型的能力确实在越来越广的范围内变强。所以你必须想清楚:你现在做的东西,是能长期成立的,还是说前沿模型在未来 6 个月或 12 个月内就会做得比你好?又或者是他们两三年内都做不到的事?这个时间窗口的判断,是你决定做什么时最需要权衡的东西。 Diana:那具体怎么判断呢?创始人该怎么推理哪些领域值得做? Jeff:最重要的事情是选择一件你超级兴奋、想要去构建、并且你认为对世界有用的东西。其次,拿当前最强的通用模型去测试你想做的那个问题域。你先看看现在的模型在这个领域表现如何,如果它们完全做不了,那大概率是个好信号。如果它们已经能做一部分了,但做得不太好,那可能是个危险信号。因为这说明这个能力已经开始出现在模型里了,随着更多训练数据、更大规模的模型,它很可能变得更好。所以你要找的是模型成功率在 0% 或 1% 的领域,而不是 20% 的领域。 Diana:那这些 0% 的领域怎么找?它们是不是本质上就是训练集之外的东西?什么样的问题形态符合这个标准? Jeff:有时候是因为你做的产品能接触到某种特定类型的数据,而底层通用模型接触不到。比如你做一个帮用户整理个人信息的工具,模型本身没有权限访问用户的个人数据。也可能是一些极其困难的问题,如果你得到了正确的训练数据,你可以训练一个比通用模型更专门的模型,而且你实际上可以以非常经济的方式做到这一点,训练一个针对特定问题的细分模型不需要那么多算力。 Diana:这么看其实有两条路。第一条路有点微妙,你们谷歌的口号是“组织全球的信息”,那个领域基本已经被覆盖了,但“组织个人自己的信息”这个方向还完全开放着。而第二条路,你刚才提到某些领域的专用模型,能具体讲讲是哪些领域吗? Jeff:你看我同事们在 AlphaFold 上的工作,那是一个专门针对蛋白质折叠的模型,非常成功,真正把那个领域处理得非常好。它不是一个通用模型,而是一个非常专门的模型。在其他领域,比如材料科学、芯片设计,这种思路也能发挥巨大作用,你可以用高度精确但小众的模型,去做今天很难做的事情。 ## 当Agent写完所有代码,稀缺技能变成了“品味” Diana:你过去说过,管理一群Agent的关键在于写出清晰的设计文档或Spec。人们如何擅长这个? Jeff:当你与Agent合作时,你越清楚你想要什么,Agent就会有越多的指导方针和规则,以及它试图完成的目标的概要。而如果你没有指定太多东西,Agent就不得不推断你的意思。在很多情况下,它可能推断出与你想象不同的东西。所以我们从一开始就告诉计算机科学家,在编写软件之前先明确说明你正在编写的软件试图完成什么。现在,指定你想要什么的重要性上升了。因为以前,你会把它交给一个非常聪明的人,他可能有上下文或者可以问你后续问题。虽然Agent有时也能做到这一点,但清晰的Spec是个好主意。 举个例子:一个效果非常好的编码Agent的用法是,你可以让今天的模型把软件从一种计算机语言翻译成另一种语言,效果非常好,因为在那种情况下你实际上有一个极其详细的Spec,你有整个软件来说明系统应该做什么。所以如果你有一个Python实现的东西,你想要一个Go实现,这是当今模型似乎非常擅长的事情。因为它可以拿Python中的所有测试,确保它们在Go版本中通过,把测试翻译成Go,比较两个实现之间的行为差异直到没有差异,并且非常高效,因为那个Spec太清晰了。 Diana:假设每个人都学会了同时跑几百个 Agent,所有代码都由 Agent 写完了,那什么技能会变得稀缺? Jeff:我认为是真正出色的品味,知道该让你的 Agent 去解决什么问题,这才是研究问题的核心。一个研究者可以拥有所有工具和技术,但大部分战斗在于:你要把时间花在哪个问题上?如果你选对了问题并且成功解决了它,那远比你把一个无聊的问题执行得漂漂亮亮要好得多。这种“该做什么”的高层智慧,我认为极其重要,而模型不太可能在这方面变得很擅长。所以,未来会是人来掌舵大量的 AI 辅助计算,去完成伟大的事情。但“你希望你的模型做什么”这个本质,才是你真正应该专注的事情。 Diana:在这个 Agent 编程的时代,品味这个词被频繁提及。但它听起来太玄学了,怎么把它变得具体?怎么培养品味? Jeff:这确实是个难题,品味在很多情况下没有一个可衡量的客观标准。我觉得一部分来自经验,过去解决过大量不同的问题,会教会你什么样的问题在未来可能有趣,或者什么样的事情通过拼接之前的方法可能刚好能实现。另一个方法是:写下你觉得未来 12 个月可能重要的一堆事情。也许你挑了其中一个去做,但 12 个月后回来评估:其他那些事情里,哪些真的变得重要了?哪些被世界上其他人做出来了?哪些还没有人碰?这能为你自己的品味培养提供大量样本。 Diana:我觉得还有第三种方式,我们之前聊到的,做非常疯狂的思想实验。 Jeff:哦对,那是另一个好方法。有时候,不要把所有大多数人视为理所当然的事情当作理所当然。比如我前几天跟同事们做了一个疯狂的思想实验:60 年来,整个硅芯片设计和制造行业做了大量工作,把晶体管做得越来越小、错误率越来越低。因为我们的假设是,每一颗制造的芯片都应该和另一颗完全一致,你不希望任何 bit 翻转。但在宏观尺度上,我们构建大规模分布式系统时并不做这个假设,我们用不可靠的部件构建可靠的分布式文件系统。单个磁盘可能坏,但你的数据应该是安全的。那么一个有趣的思想实验是:如果你试图用每天可能出 20 次错的晶体管来构建系统,而不是每一百万年才出一次错,会发生什么? 那会是一个非常不同的设计点,可能会在制造端带来非常有趣的可能性。 Diana:太疯狂了,这开始跟神经形态计算或者人脑的工作方式产生共鸣了。 Jeff:完全正确。大脑中的信号从一个地方传到另一个地方并不是特别可靠。所以在大脑里,当有真正重要的信息需要传递时,会有多条通路来确保信息能到达。 Diana:有没有一个你抛弃的疯狂假设,最终真的构建出了一个有影响力的系统? Jeff:TPU 就是一个好例子,在一个问题领域看起来还没有今天这么重要的时候,就为它专门定制硬件。MapReduce 的起源是另一个好例子。我和 Sanjay 以及一些同事之前写过很多手写并行化的代码,做了大量 checkpoint 来确保在几百台或几千台机器上运行时足够健壮。但那些代码往往和你要做的简单事情混在一起,比如“我想看看所有网页的内容,然后计算 URL 到页面语言的映射”,却被大量并行化和可靠性代码淹没了。我们想起了函数式编程的训练,意识到可以眯着眼看这些问题,抽象出 MapReduce 这个抽象层,把 checkpoint 和可靠性机制都放到底层库里,所有东西都构建在它之上。所以,从那个“如果我们眯着眼看,能不能找到大量适合这个抽象的问题”的思想实验里,诞生了 MapReduce。 ## 用AI构建更好的AI Diana:现在 AlphaChip 在布局芯片,AlphaEvolve 在提出解决方案、评估并保留有效的方案,看起来你正在构建一套能够自我复合的系统——AI 在构建 AI。 Jeff:更广泛地说,这其实是科学方法的基础:提出实验、实现实验、评估实验、获得结果。现在有越来越多的问题域,可以不只是跑几个实验,而是跑大量实验,因为你能够自动化这个循环,让循环的延迟变得极低,这会让我们能够处理科学、工程、机器学习、模型设计本身,以及芯片设计等工程任务中的大量不同问题域。如果你能自动化这些,并且有一个编排框架,能把高层目标分解成子问题,每个子问题都是自动化的探索循环,然后编排框架再把子问题的解决方案整合成整体方案,这将产生巨大的影响,会加速机器学习、加速科学、加速工程。 Diana:听起来很多领域,只要有好的评估器,或者能被形式化验证的领域,都适合 AI 自我改进。 Jeff:对,很多时候你的评估器需要变得更快。举个例子,我的同事们大约十年前在量子化学领域做了一些工作,你想了解某个分子的性质,可以生成一个分子构型,然后想知道它有什么性质,你可以跑一个计算量非常大的密度泛函理论模拟器,那可能需要一整晚的计算才能给出一个答案。但我的同事们做的是:拿大量模拟运行的输出,输入的分子构型和昂贵模拟器的输出,然后训练一个神经近似器来替代模拟器。他们做出了一个比原模拟器快 30 万倍、精度几乎一样的验证设备。这完全改变了你做科学的方式,你可以在吃午饭的时间里筛选 1000 万个候选,而不是花六个月去凑够计算资源跑完所有模拟。在很多领域,更快的验证模型,有巨大的空间。 Diana:那你特别期待这个超速科学方法解决哪些领域的问题? Jeff:显然机器学习本身就是一个。能不能有一个模型,通过跑大量实验来自我改进?今天大型研究团队改进模型的方式是:人们想出一些想法,跑一批小规模实验,看哪些有效,然后把最有希望的放大规模,评估,整合成新的配方。但没有任何真正的障碍阻止这变成一个更自动化的循环,模型自己决定探索什么,或者在高层次上由人轻轻推一下“为什么不试试包含这个的模型架构新想法”,然后它就跑大量实验,看哪些有效,以更快的速度整合。本质上,你要优化的是每单位计算输入的发现数量。 Diana:2014年你和Geoff Hinton、Oriol Vinyals写了一篇关于蒸馏的论文,即用一个大模型训练一个更小、更高效的模型,现在这已经成为行业里每个人都在用的技巧,但这篇论文被NeurIPS拒了。 Jeff:对。我不怪程序委员会,因为很多时候一篇论文收到三份评审意见,有人看了一眼说“不太可能产生重大影响”。但当我们写这篇论文时,我们看到了这是一个超级重要的问题,因为我们知道从更大规模的模型做出更便宜、能力更强的模型,是我们迫切想做的事情,我们想在语音、视觉等许多领域,把模型服务给越来越多的人。但有时候评审者可能没有那样的经验,他们可能不是在考虑大规模 AI 服务,而是在想“这是一个根本性的进展吗?”所以偶尔被拒也没关系。我们把它放上 arXiv,人们读它、用它,一切都好。我们确实在用蒸馏技术做我们的 flash 模型,从更大规模的 pro 模型蒸馏出来,这就是为什么我们的 Gemini flash 模型在同等规模和速度下如此有竞争力。 Diana:你 1999 年加入 Google 时,它还只是个 20 人的初创公司。如果把年轻的 Jeff Dean 从那时传送到现在,以你的技能,你会怎么做?你会加入前沿实验室,还是创办一家公司? Jeff:对我来说,最重要的问题是:你要做的这件事,是你真正在意的吗?如果你能和一群你喜欢共事的同事一起取得进展,这件事能以某种积极的方式改变世界吗?你应该努力的是:对世界产生积极的影响,和你喜欢的人一起工作,努力工作、做到最好。至于加入前沿实验室还是创办一家两三个人的小公司,那是不同的体验。在大机构里,有大量出色的同事,有大量有趣的问题,而且你已经有了一个平台可以让你的工作影响世界上很多人。而作为一个小型初创公司,你必须有你充满热情的东西,而且承担这个特定问题的风险很大,但这也可以是非常有回报的。无论你走哪条路,问自己:如果我解决这个问题,最好的结果发生了,世界会变得好很多吗?还是世界会说“哦,挺酷的,但无所谓”,这就不值得你花时间。 Diana:你一直是很多工程师的导师和管理者,也构建了庞大的系统。怎么和聪明人合作、怎么找到聪明人,有什么经验? Jeff:你总是想找到在你需要的领域有真正出色技能的人,但你也想找到你乐于与之相处的人,因为你会花大量时间和他们一起解决非常困难的问题。你想要低自我、有团队精神、技能与你互补的人。我总是觉得,在一个小团队里,别人知道我不知道的东西,而我也有一些别人不具备的技能,这超级有趣,因为你们在共同构建一个你们任何一个人都无法独立完成的东西。在这个过程中,你实际上获得了大量新知识、新技能,他们也一样。你应该把自己的工程或研究职业生涯看作一条装满技术的工具带,你总想往上面加新工具,因为你永远不知道什么时候会遇到一个问题,添加更多工具使得你未来遇到的问题更有可能被你解决。 Diana:我相当确定在座有人最终会构建出像你做的MapReduce、TPU、蒸馏等一样有影响力的东西,你希望他们在研究什么问题? Jeff:我特别兴奋的是硬件的新方法,或者更高效的推理硬件。我认为可能有根本不同的机器学习算法,比我们今天用的方法数据效率高得多。今天的模型,它们看到的数据量可能是一个18岁的人能看到的一千倍。但一个18岁的人,在很多事情上比那些看到了更多数据的前沿模型持平甚至更好。所以你能不能想出更数据高效的系统,能从自己的行为中持续学习?持续学习是一个非常有趣的方向,多Agent交互也很有趣。创造让人们更好地对话的方式,帮助世界各地的人们根据兴趣认识彼此,这些都可能很有意思。世界上有很多酷的事情,我们都应该去努力让更酷的事情发生。 访谈视频原链接:< 参考链接: <https://x.com/FakePsyho/status/2085076119103909966>" <https://x.com/JeffDean/status/2085034604172603724>"
资讯同步's avatar
资讯同步 1 hour ago
#InfoQ推荐 ![](https://static001.infoq.cn/resource/image/7b/48/7b7c177b39aa8df1e37b7b8179ee5b48.jpg) 如果一名开发者怎么都用不好 Agent,问题可能并不在开发者,而在公司根本没有为 Agent 准备好一套能工作的系统。 很多企业所谓的 AI 转型,仍然停留在给开发者购买 Cursor、Claude Code 等工具,办几场培训,再让大家自行摸索。如果最后 Agent 效果不好,责任又落回到使用者身上。 但DevOps 一词的提出者 Patrick Debois 认为:“开发者需要完成一个重要的思维转变:当 Agent 没有按你的预期完成任务时,不要再去修改它生成的代码,而要去改进整个系统,而不是只改 Prompt。” 在 Debois 看来,这是软件工程从确定性系统转向非确定性、概率性系统和工作流时必须经历的变化。它不仅涉及技术,也会重塑开发者、团队和整个组织的工作方式。但这种变化不可能只靠某一个工程师,也无法仅停留在单个团队层面。它和 DevOps 一样,只有在规模化落地后,才能真正实现。 问题的核心不只是开发者会不会用 Agent,而是公司能否围绕 Agent,重新组织团队、平台和协作方式。 核心观点如下: 不要再修 Agent 产出的代码了,去修那个产出代码的系统。如果你团队里还有人用那种“YOLO(先跑通再说)”的野路子搞 vibe coding,你应该立刻制止。工程实践不仅对你维护系统至关重要,对 Agent 自身持续变好也至关重要。暗工厂可能不是全暗,而是保留了一点微光(dim factory),这意味着你得决定对什么功能承担多少风险,不是所有功能都适合完全自治。能极致用 AI、有扎实工程功底、愿意分享和协作,将这三点组合,才是你要找的人。你的护城河,是抓住沉淀下来的知识,那些你现在注入到 skill 里、Context 里、甚至 Harness 约束里的业务上下文。 ## 给开发者配上 Claude Code,组织就转型了? ![](https://static001.geekbang.org/infoq/18/1830cf64940046f787a7abb0f5755e65.png) 2009 年的时候,一大堆人告诉我持续交付这个想法简直是疯了。 译者注:2009 年,行业普遍采用数月一次的大版本集中上线模式,大家默认发布次数越多风险越高,加之开发与运维壁垒森严、容器与云等自动化基础设施尚未成熟,缺少标准化pipeline工具,同时传统测试、变更审批机制追求上线前尽可能扫清缺陷,而持续交付提出高频、增量、随时可发布的思路,颠覆了大众对软件上线风险、流程管控的固有认知,因此在多数企业看来近乎天方夜谭、十分疯狂。 而现在,暗工厂又遇到了完全一样的阻力。 译者注:暗工厂指 AI 驱动的自治软件生产模式,人类只输入SPEC,由 AI 自主完成编码、测试与上线,无需人工逐行审查代码,区别于仍需要大量工程师参与流程的传统软件工厂。 我在各种场合反复听到同一句话:“这东西在我们这儿行不通。”但这句话真正在传达的信息不是技术不行,而是“我们还没准备好”。他们不是不想实现这个东西,而是现在整个组织的设置还没法支持这种模式。 现在很多人都在讲怎么用循环优化 Agent,怎么搭 Harness,这些都很棒。但我想说的是,最终我们都会达到那个技术水平,终有一天它们会变成某种标准商品,甚至被某个前沿实验室打包成服务提供出来。到了那一天,技术上就没壁垒了。真正的差异化,在于你的组织怎么围绕这个东西重构协作方式。 所以我假设我们都在往暗工厂的方向走。我在 Tessl 以及别的公司里观察到的是,当人开始采用这些技术时,协作的动态关系会彻底改变。你们如果熟悉康威定律,就知道组织方式和工具之间存在一种相互塑造的关系——你怎么组织人,就会造出什么样的系统。但我今天不想讲怎么让你的 Agent 变得更好,我要讲的是这如何改变你的团队动态、你的平台以及你的整个组织。 我猜在座大部分人都在某个团队里工作,而不是单打独斗,团队协作和一个人对着 Claude Code 敲东西是完全不同的两码事。 现在大家都喜欢讲一个说法:开发者最终会变成一个指挥家、一个 Agent 的编排者。我觉得这个说法没毛病,这确实是我们正在走的路径。我们越来越像 Agent 的管理者,要处理和 Agent 之间的关系。 但问题是,我听到很多开发者私下说:我们当初入行可不是为了干这个的,我们没想过要花大量时间去优化 Prompt、去写更好的SPEC。我们是工程师,我们搞的是技术,这让我们有一种身份上的摩擦感,会不断问自己:这真的是我想做的角色吗? 后来出现了一个概念叫“Context engineering”,算是给了开发者一个台阶下。它说的是,这不仅仅是调 Prompt,你还要测试、评估、分发、优化 Prompt,所以确实有那么一点工程的味道在里面了。但说实话,很多开发者仍然觉得只跟 Prompt 和SPEC打交道很空虚,感觉自己从工程师变成了“提示词管理员”。 但我在实践中观察到一个很有意思的转折点。当我们开始引入 Harness、循环,甚至让整个组织走向更高程度的自治时,一条全新的技术路径打开了。突然间,开发者需要帮 Agent  造工具,这一下子就重新点燃了一批人。那些之前觉得“这不是我该干的”的开发者,瞬间就来劲了。他们说,没错,我们能干这个!我们掌握这种知识!我们可以用编程的方式帮这个系统变得更好。所以这很有意思,当我们一直在讲“抽象、抽象、再抽象”的时候,“手艺”感反而在另一个位置重新冒了出来,为更硬核的工程工作找到了新的空间。 ## 不要修代码,修产出代码的系统 经常有人问我:怎么搞定那些持怀疑态度的人?我的回答永远是:这些人其实是你的宝贝。因为他们脑子里有大量的隐性知识和判断力,你需要把这些东西灌进 Agent 里。你可以告诉他们:“请把你所有的知识和挑剔都拿出来”,这能让 Agent 和 Harness 变得更好。如果你碰到那种比较抗拒的,天天抱怨说“这玩意儿生成的代码质量太差了”,你可以把他们当作燃料,把这股愤怒和怀疑,变成改进系统的动力。 现在让我给公司的开发者们提一条建议,我会提出一个巨大的心态转变:不要再修 Agent 产出的代码了,去修那个产出代码的系统。就像几年前有人说过一句话:别造那个东西了,去造那个能够造那个东西的东西。我们现在就在这个抽象层级上,通过 Context、Harness、循环来造“能造东西的东西”。很多还停留在“Human in the Loop”、自动补全、调 Prompt 这个阶段的人,需要思考怎么把自己拔高到系统思维上来。 ![](https://static001.geekbang.org/infoq/c8/c83739f62602dea38f0c4dda39cc5b82.png) 我们真正要做的,是用好的工程实践来最小化人类的干预次数。刚开始的时候,大家都觉得“vibe coding”很爽,丢个 Prompt,出一个结果,管它呢继续往下跑。但现在越来越清楚的是,我们不只是通过 Prompt 给 Agent 下指令,我们其实在说:请带测试一起写、请更新文档、请遵守代码规范。原来我们对好工程师说的那些话,现在全部原样搬给 Agent。如果你团队里还有人用那种“YOLO(先跑通再说)”的野路子搞 vibe coding,你应该立刻制止。工程实践不仅对你维护系统至关重要,对 Agent 自身持续变好也至关重要。 我在一些走得比较靠前的团队里开始看到一种新的仪式,他们仍然做计划会和回顾会,但讨论的内容彻底变了。回顾会上不再说“代码出了什么问题”,而是说“系统出了什么问题?” 在计划会上我也看到了一个有趣的分裂。那些定义得非常清晰、范围足够明确的任务,直接就能丢给 Agent 去做,因为 Harness 越来越好,它们能消化这种明确的任务。而那些边界模糊、需要商量的事情,依然留给人类。所以计划会上出现了一种自然分工:这些卡片直接走 Agent 流水线,那些卡片我们来聊。 开发者通常会经历一个学习周期:先学 Prompt,然后是更好的 SPEC,接着是 Context、Harness、循环,整个行业也在这个周期里爬。但团队 Lead 可以做的,是给这个进程设定节奏和约束,比如告诉他们:“别再调 Prompt 了,把 Context 做成可复用的。”“好,这一步做完了,我们跳到下一步。”团队 Lead 的价值就在于设定这种节奏,如果你只是丢下一句“自己去摸索”,那是不灵的。 还有一个连带效应:一旦你们团队的生产率开始暴涨,下游的人,比如搞 GTM(Go to Market) 的会跟不上,甚至用户也会跟不上。所以你需要用自动化来帮助他们,你的框架不能停在编码这一步,必须延伸到他们那边去。同样的道理也适用于上游的需求输入,如果需求来得不够快,团队就会被卡住,这些环节也需要被卷入这个新的工作流里。 现在市面上有一堆指标,什么 Token 花费之类的。但我开始越来越相信两个真正能衡量生产力的指标。第一个:你数一下,要让 Agent 做对一件事,你还需要多少次人工干预?这个数字应该是持续往下降的。你的 Harness 越好,Context 越好,指南越清晰,这个数字就越低。第二个指标,是当你从单兵作战转向共享系统时,有一个乘数效应。你在一个地方修好了某个东西,所有人都跟着受益。这不是说一个人变成十倍效率,而是一次对 Agent 系统的优化能在所有人身上产生乘数效应, 你可以在一个仓库里、一个小团队内部先启动,共享 Context,一起改进 Harness。但你真正想要做的,是把这种效应扩展到整个组织。这时候,我们就不得不谈到平台团队了。 ## 别让每个团队都造一套 Harness 平台团队是典型的共享型组织,现在他们可能在搞基础设施、云服务、MCP 网关之类的东西,没太关注 Agent 这块。但有一堆新东西正在冒出来,需要他们接手,比如技能注册中心(不能让每个人都在自己的角落里发明同一套技能)、Context 的评估系统(这段 Context 到底有没有用?能不能量化?)、专门针对 coding agent 的护栏和身份管理(Agent 以谁的身份提交代码?权限边界在哪?)。所以平台团队需要有人拉一把,帮他们成长到这个新的中心角色上。 ![](https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png) 这事很难,你必须有一个明确的 owner 来驱动。但这该是谁?平台团队?开发者体验团队?前者通常不碰那些开发层面的东西,后者又不怎么碰基础设施,所以需要某种融合,但这个融合不会自动发生。你需要确保有一个负责人来推动这个中心化的工作,否则你的团队就只是在自己的一亩三分地里折腾,不会有“Paved Road(铺装路)”出现。 为什么我们每个团队都要各自发明一套认证系统的对接方式?这是共享组件,应该放进注册中心。为什么要各搭各的 Harness?如果我们都用同一个 linter、同一套安全扫描工具,那这就是可复用的组件。我认为这会像当年云基础设施的铺装路一样,逐步集中到平台注册中心里。 但问题是,如果谁都能往这个中心仓库里随便丢东西,就会迅速野蛮生长(becomes a sprawl)。比如一个skill放上去了,谁在维护?另一个人又 fork 了一个类似的skill,那我该选哪个?所以必须有人明确拥有某个领域,他要确保这个东西是可测试的,是模块化的,别人能在这个基础上扩展 Context 或者 Harness 里的安全扫描部分。你得用集中化的方式来做,而不是在组织内部随便传。 建立共识很难。这不像 tabs 和 spaces 之争那么有名,但有时候感觉差不多。如果你让两个开发团队就工作方式达成共识,那需要大量的沟通和调停工作。所以最后你很可能不是只有一条铺装路,而是三条四条,他们可以从中选。如果他们非要自己搞一套,也可以,但那是他们自己的预算。集中维护的才是“轻松路径”,用来吸引大家走上去。 如果大家盲目地使用这些共享能力,你必须让他们看到成本。只要你把花费可视化出来,他们自然就会想去优化。这是平台团队的分内之事,让花费透明化:花了多少?帮到了什么程度?如果我能减少 Agent 的迭代次数,那就是优化。但如果我看不到这个指标、只看到最终结果,那我就没法下手,可视化是一切优化的前提。 所以我的核心主张是:我们要从单打独斗的开发者,走到团队层面的共享 Context 和共享组件,最终走到整个组织内部的“多人游戏系统”。乘数效应会在那里爆发,因为你有一个飞轮,改进可以向多个方向同时辐射。 ## 超级个体救不了 Agent 时代的组织 再往上一层,VP 工程部怎么思考这件事?我差不多能预测你们组织里会发生的故事:黑客松或者午餐分享会、分享成功案例、建一个共享 Slack 频道、搞一个 champions program。这些都是通用的转型套路。当年Agile转型这么干过,DevOps 也这么干过,没什么新鲜的。 另一方面我们也知道,“发许可证、搞培训、让大家自由发挥、让一千朵花绽放”这个策略从来就没成功过。一千朵花的结果通常是一千根杂草,百花齐放但没有一朵能结果。所以我主张,在组织侧要明确授权,让团队 Lead 和平台团队去做这件事。它不是靠某个超级个体就能完成的,必须有人被正式授权去推动。 找人帮忙也是头疼事。现在的职位名称一塌糊涂,AI 产品工程师、forward deployed engineer、agentic 工程师、AI 工程师……这些词其实没什么实质意义。你没法通过头衔判断一个人的成熟度,因为整个行业都不成熟。不过你发招聘需求的时候,这些词确实能带来一些信号,吸引有意图的人来投,但它本身并不代表对方就一定具备相应技能。我还听过一些更离谱的故事,有的候选人在面试时用 AI 在耳朵里实时给答案,面试官问一个问题,AirPods 里就传来 AI 的建议。 所以我听到越来越多公司采用这样一种面试方式。第一步,给一个练习,让他们用 AI 放手去解题,使劲用。如果 AI 能帮他们搞定,那恰恰说明他们擅长利用 AI。第二关,请他们查自己的方案,解释“你为什么要选这个方案?你怎么验证它是对的?”,这时候你在测试的是测试能力和工程判断力。前半段考 AI 利用能力,后半段考工程功底。第三,还要看他们怎么协作,愿不愿意分享,是开放型还是单干型。有的人技术很强但什么都要自己捏在手里,这种人在 Agent 时代反而会成为瓶颈。 能极致用 AI、有扎实工程功底、愿意分享和协作,将这三点组合,才是你要找的人。不是学过 ML 或 AI 的,也不是什么解码专家,而是一种混合体。你很可能找不到三点全满的人,那也没关系,比如某个候选人在某方面特别强,但在另一方面需要指导。同时,别把这些技能混在一起贴上“初级”或“高级”的标签,它们是不同的技能维度,一个人可能 AI 利用能力是“高级”,但协作意愿是“初级”。 VP 工程部还得向上交差。我们买了这么多许可证,能证明投入产出吗?交付变快了?可能有承诺但很难证明。质量变好了?同样很难说。但回到我之前说的那两个指标,你可以展示干预次数减少了多少,改进了多少,还有复用率提升了多少。这比去比较“有 Agent 和没 Agent 的编码生产力”要容易得多,也更有说服力。 所以,当有人抱怨 Agent 太能花钱,说要限制额度的时候。你的本能反应不应该是“我们把所有花费都砍掉”,而应该是“我们怎么优化花费”。最简单的做法是选对模型,不是所有任务都需要最强的模型,有些任务用便宜的模型就够了。教育开发者什么场景用什么模型,更进一步,给他们更好的 Context 和 Harness,这会让 Agent 少走弯路,成本降得更狠。 还有一个关于团队规模的话题。一个全能型人才把所有活干了,那是终极梦想。但你仔细算一下:这个人通常得搭配互补技能,比如产品经理或设计。然后你还要考虑预备人员(backup),万一有个人休假了呢?这就又回到三个人了。再然后可能还要有人盯生产和工单,如果你真的极度高效,可能是同一拨人兼职做。但你一旦修 bug,做特性的速度就会下来。最后还有新人,你要给他们铺路,让他们知道“好”是什么样的。所以我依然认为,在组织里我们不可能真的让每个团队变成一两个人。 最后,暗工厂可能不是全暗,而是保留了一点微光(dim factory),这意味着你得决定对什么功能承担多少风险,不是所有功能都适合完全自治。你可以在审计方面投入更多,比如溯源,谁改的代码?是人还是 Agent?加验证器检查代码是否真的有用,当自动流程失败时投资于情景感知能力。从完全微观管理(每行代码都要人看过),到完全自主审批(假设 Agent 产出都是对的),这是一整个光谱。你要做的,是根据风险水平为不同类型的变更选择不同的自动化程度。 ![](https://static001.geekbang.org/infoq/dd/dd6fe4cb16d600d958992a47ac67643c.png) 而我认为你的护城河,是抓住沉淀下来的知识,那些你现在注入到skill里、Context 里、甚至 Harness 约束里的业务上下文。对我来说,这实际上把持续交付带向了持续学习。试问自己:我们能多快地把一个新东西换进系统、再把一个旧的东西换出来?这是你的反应能力。如果你能持续改进这种能力,问题的关键就不再是“我要让整个系统更可靠”,而是“我能不能在改变系统越来越多部分的同时,保持它的可靠性?” 如果只带走一句话,那应该是:赢家不会是那个单打独斗的超级玩家,而是那些在多个层面上懂得如何改进组织的人。 演讲原视频链接:
资讯同步's avatar
资讯同步 1 hour ago
#华尔街见闻 近期,各大指数波动加剧,微盘股却走出了一波独立行情。自7月22日见底以来,该指数累计反弹超15%,相关ETF产品份额激增近120%,资金净流入近70亿元,同时,微盘策略主题基金也开始“逆袭”回血。 业内人士表示,总体来看,微盘股这轮修复的底层逻辑较为扎实,它是市场在经历了极致偏离后,自身再平衡力量的体现,微盘股行情或从“超跌反弹”逐步转向“分化修复”。(中国基金报)
资讯同步's avatar
资讯同步 1 hour ago
#华尔街见闻 AI芯片热潮令三星电子与SK海力士坐拥史无前例的现金储备,但两家公司在财报季对股东回报计划的模糊表态,正在激怒投资者,并加剧股价的持续下行压力。 **SK海力士上周财报电话会议上仅表示"正在考虑额外措施"以提升回报,未给出任何具体承诺;三星则称正在讨论今年及未来的股东回报政策,将"很快"公布细节。**两家公司股价已分别从历史高点回落约48%和37%,市场对现金分配效率的质疑情绪持续升温。摩根大通分析师本周下调了SK海力士的目标价,指出"明确的资本分配立场对于恢复市场信心至关重要"。 上述压力不仅来自机构投资者,零售投资者平台ACT本周亦发起运动,要求三星召开临时股东大会并启动约320亿美元的股票回购计划。分析人士指出,若管理层迟迟不愿承诺更大规模的股东回报,市场可能将其解读为公司内部对AI盈利持续性缺乏信心。 ## 50%回报率 vs 100%回报率:美光的参照系 据LSEG数据及其计算,**三星与SK海力士的合并净现金储备预计到今年年底将达2630亿美元,是AI领域标杆企业英伟达约1020亿美元的逾两倍,同时超过美国"科技七巨头"其余六家公司的现金总和。** 测算显示,三星与SK海力士当前目标是将自由现金流的50%用于股东回报。今年6月,美国存储芯片厂商美光科技已承诺将这一比例提升至100%。差距在数字上刺眼。 Janus Henderson Investors基金经理Richard Clode直言:"如果坚持50%的自由现金流回报率,资产负债表将变得极其低效。"他呼吁SK海力士将回报率至少上调至80%。Clode进一步警告,如果管理层表示"对未来不太确定,无法承诺长期大规模股东回报计划",就等于在"喂养'这只是暂时的、周期性的'这一叙事"。 SK海力士在上周财报电话会上仅表示正在考虑额外回报措施,将在年内公布计划。新加坡对冲基金Vista Global Asset Management基金经理Kim Kyu-shik表示: > "电话会后我非常愤怒。股东们在听电话会,期待的是希望的信号。" ## "不承诺"的信号:市场在怀疑什么 **投资者和分析师指出,在AI驱动下两家公司报告创纪录利润,却缺乏大规模股东回报计划,这一反差可能被解读为管理层对AI盈利的持久性并不确信。** 这种解读也是股价大幅回调的深层驱动力。三星与SK海力士在国际科技同行中——如苹果和台积电——的股东回报方面已然落后,此次争议进一步激化了投资者对"韩国折价"的不满。 SK海力士在声明中回应:"基于创纪录的现金生成能力,公司相信可以在维持投资和财务稳健的同时,有意义地扩大股东回报。"三星表示正在讨论今年及以后的股东回报政策,目标"很快"公布细节,并称"在保持健康资产负债表以管理周期性风险和资助增长计划的同时,也在探索以可持续方式提升股东回报的途径"。 ## 投资与回报不是"二选一" 三星与SK海力士维持高现金储备有其历史逻辑——存储芯片业务资本密集且周期性极强。**今年两家公司合计承诺了3200万亿韩元(约2.07万亿美元)的国内投资以满足AI需求。** 但韩华投资证券分析师Park Jun-young指出,两家公司正与主要客户签订多年供应协议,这将帮助它们避免此前繁荣期过度扩产的陷阱,从而释放更多现金用于股东回报。Klay Group股票主管Aadil Ebrahim也表示,考虑到预期的现金生成能力,"两家公司应该能够在为投资提供资金的同时,交付实质性更强的股东回报",投资与回报并非"二选一"。 Ebrahim引用了苹果2013年的资本回报计划作为先例——当时公司计划到2015年返还1000亿美元,其中包括将股票回购计划扩大六倍至600亿美元。他认为,改善资本配置"可能随着时间推移在缩小韩国折价方面发挥重要作用"。 市场将密切关注三星承诺的"很快"公布的具体时间表,以及SK海力士年内披露的回报方案细节。对投资者而言,2630亿美元现金池的真正价值,最终取决于管理层是否有意愿将其转化为股东手中的真实回报。 风险提示及免责条款 市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
资讯同步's avatar
资讯同步 1 hour ago
#华尔街见闻 亚马逊创始人贝索斯(Jeff Bezos)正在加速套现旗下核心资产。在亚马逊股价创下历史新高之际,贝索斯本周完成了今年首批股票出售,套现近3.5亿美元,而这仅是其更大规模减持计划的开端。 根据周三收盘后披露的监管文件,贝索斯此次出售的股份数量,仅占其此前两天在另一份文件中披露的拟减持规模的一小部分——后者显示,**他计划出售最多1500万股亚马逊股票,总价值逾40亿美元。** 亚马逊股价今年以来已累计上涨超20%,上周该公司凭借强劲的云计算业务营收,**成为全球第五家市值突破3万亿美元的企业**。 ![](https://wpimg-wscn.awtmt.com/83ac0f98-67b8-4494-b116-186ff2107e44.png) 大规模减持并未动摇贝索斯的第一大股东地位。完成此次出售后,**他仍持有亚马逊8.16%的股份,依然是公司最大单一股东。**与此同时,据彭博亿万富翁指数,贝索斯今年个人财富已增加387亿美元,总计达2920亿美元。 ## 首批套现:创纪录股价下的精准出手 贝索斯此次减持的时机颇为引人关注。监管文件显示,相关交易于8月3日执行,彼时亚马逊股价正处于历史高位。此次出售近3.5亿美元股票,是贝索斯今年以来的首次减持操作。 在此之前两天,贝索斯已通过单独的监管文件披露了更大规模的减持意向——拟出售最多1500万股,按当前股价计算价值逾40亿美元。此次实际成交的股份数量仅为计划上限的一小部分,意味着后续仍有大量减持空间。 **贝索斯近年来的减持节奏明显加快,与其早年的低频操作形成鲜明对比。**自亚马逊1997年上市至2020年,他累计出售股票不足100亿美元;而仅2020年至今,出售规模已超过380亿美元。 2024年尤为密集——在连续九个交易日内,贝索斯共套现逾85亿美元。进入2025年,他还通过股票捐赠的方式向非营利组织贡献了目前市值逾10亿美元的亚马逊股份。 据彭博报道,贝索斯的大规模套现,与其近年来日趋高调的个人消费及商业投资密切相关。 2023年底迁居佛罗里达州后,贝索斯在迈阿密地区累计斥资逾2.3亿美元购置房产,并耗资约5亿美元订购了一艘417英尺长的超级游艇。 与此同时,他于2000年创立的航空航天公司蓝色起源(Blue Origin)正在进行首轮外部融资,估值达1300亿美元。此前,蓝色起源完全依赖贝索斯个人资金支撑运营,此次引入外部资本标志着该公司发展进入新阶段。 风险提示及免责条款 市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
资讯同步's avatar
资讯同步 1 hour ago
#华尔街见闻 8月6日,Artificial Analysis公布了新一期榜单,阿里Qwen3.8-Max在智能体能力(Agentic Index)排行榜中,超越Claude Opus5、GPT5.6,位列全球第一。 Agentic智能体能力代表AI调用工具解决更复杂问题的潜力,是AI落地各专业场景的关键。这一领域冠军长期被Claude、GPT等垄断,此前中国模型最好的成绩是Kimi K3 的50.1分,阿里Qwen3.8此次以55.4分夺下Artificial Analysis的智能体能力排行榜冠军。(硬AI)
资讯同步's avatar
资讯同步 1 hour ago
#华尔街见闻 美国银行首席执行官Brian Moynihan预计美联储将在年内三度加息,但同时认为利率上行不会阻断人工智能基础设施投资热潮。与此同时,多位美联储官员相继发声,呼吁尽快采取行动压制通胀,政策收紧预期明显升温。 **Moynihan在接受CNBC采访时表示,美联储将分别于9月、11月和12月各加息一次。他预计通胀将在2027年底降至"2%中段"水平,此后再逐步回落至美联储2%的长期目标区间。与此同时,明尼阿波利斯联储主席Neel Kashkari明确表示,现在就应开始逐步加息,"我宁愿现在小步推进,也不愿等到通胀根深蒂固后再被迫大幅收紧"。** 在市场层面,CME FedWatch工具数据显示,9月加息25个基点的概率为56.9%,10月为53.2%,12月为43.7%。截至发稿,标普500指数ETF(SPY)微涨0.02%,纳指ETF(QQQ)下跌0.37%,道指ETF(DIA)上涨0.8%。 ## 三次加息路径:Moynihan的利率预判 **Moynihan预计,美联储将在9月、11月和12月连续三次加息,以将通胀纳入可控区间。"如果数据表现优于预期——就像上个月那样好于市场预期——我相信他们会调整判断。但就目前而言,他们认为三次加息足以让美联储实现对通胀的管控"。** 在通胀走势上,Moynihan预计2027年底PCE将降至"2%中段",随后进一步收敛至美联储长期目标。他指出,通胀此前已在缓和,但关税带来的价格压力以及地缘冲突的影响导致其再度反弹,目前这些因素正在逐步消退。 美国商务部上周发布的数据显示,美联储首选通胀指标——个人消费支出(PCE)指数6月按年率上涨3.7%;剔除食品和能源的核心PCE按年率上涨3.3%,较5月的3.4%小幅回落,环比增长0.1%。 ## AI投资逻辑未变:高利率难阻数据中心扩张 尽管加息预期升温,Moynihan认为这不会对AI基础设施投资产生实质冲击。他指出,**目前企业用于AI基础设施建设的融资以短期资金为主,利率上行的直接影响有限。** 他进一步表示,**数据中心建设带来的回报足够高,即便长期债券利率上升,相关企业也有能力消化额外的融资成本。这一判断意味着,在Moynihan看来,AI资本开支的内在逻辑并不依赖于低利率环境。** ## 美联储内部鹰声渐起:多位官员支持加息 美联储内部的鹰派声音正在集聚。在上周的联邦公开市场委员会(FOMC)会议上,美联储以9比3的投票结果维持利率在3.5%至3.75%区间不变,但克利夫兰联储主席Beth Hammack、明尼阿波利斯联储主席Kashkari和达拉斯联储主席Lorie Logan三人持异议,均倾向加息25个基点。 Kashkari在CNBC采访中表示,企业盈利表现强劲,消费者和劳动力市场均保持韧性,"我看着这些数据,找不到货币政策当前特别具有限制性的证据"。他表示,应从9月起小步加息,以免通胀进一步根深蒂固。 美联储理事Lisa Cook虽在上周投票中选择按兵不动,但措辞明显趋紧。她在阿拉斯加的一次讲话中表示,"如果我近期看不到通胀持续回落的迹象,我已准备好采取行动"。Cook指出,在通胀连续五年高于目标的背景下,价格和工资定价行为被锚定在高位的风险正在上升,"我们没有在不同的环境中那种等待的奢侈"。 堪萨斯城联储主席Jeff Schmid(今年无投票权)则直接表态,称通胀水平依然过高,压制通胀需要更高利率,并认为当前货币政策立场并不具有限制性。 ## 市场定价:加息预期已部分反映 目前,市场已开始消化年内多次加息的预期。CME FedWatch工具数据显示,9月首次加息25个基点的概率为56.9%,10月为53.2%,12月为43.7%,与Moynihan的三次加息判断基本吻合。 债券市场方面,iShares 20年期以上国债ETF(TLT)小幅上涨0.13%,iShares 7至10年期国债ETF(IEF)微跌0.03%,走势整体平稳,反映市场对加息节奏的预期尚在消化之中。 风险提示及免责条款 市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
资讯同步's avatar
资讯同步 1 hour ago
#华尔街见闻 8月5日盘后,西部数据和闪迪同步发了2026财年Q4财报。两家都超预期,闪迪还批了140亿美元回购。然后——西部数据盘后跌了11%,闪迪跌了7%。 ![](https://wpimg-wscn.awtmt.com/9c16aefb-28ea-48b6-b86d-f7624afb3a63.png) ![](https://wpimg-wscn.awtmt.com/956a9ea8-493b-4809-86b9-f8858d171070.png) **这个画面今年已经反复上演。**业绩创新高、股价创新低。7月SK海力士盘中暴跌30%的记忆还没消退,存储板块的抛售又在继续。这不是一两家公司的问题——**是市场对整个存储超级周期的定价逻辑在松动**。 ## 闪迪:毛利率84.6%的生意 [财报显示](https://wallstreetcn.com/articles/3778788),闪迪Q4营收89.65亿美元,同比增长372%,环比增长51%。GAAP净利润69.03亿美元(稀释每股收益43.97美元),去年同期是净亏损2300万美元。non-GAAP每股收益39.25美元,远超华尔街预期的34.37美元。毛利率84.6%。 驱动这一切的核心变量就一个:NAND颗粒价格。闪迪官方披露,Q4营收环比增长中,约三分之一来自出货量增加,三分之二来自涨价。 更关键的变化在客户结构。Q4数据中心收入29.77亿美元,环比翻倍,同比暴增1298%。数据中心出货比特占总出货量的比例,从一年前的12%飙升到了38%。边缘设备(手机、PC、汽车等)收入54.32亿美元,环比增长48%。消费类收入5.56亿美元,环比下降32%——公司选择性把产能从零售渠道抽走,灌给了企业客户。 CEO David Goeckeler在电话会上总结得干脆:「消费者业务就是跟不上交易市场的节奏。」 **最能体现转型方向的是闪迪反复提及的「新商业模式」(NBM)——云厂商提前锁量锁价,闪迪拿到收入可见性和财务保证金。** Q4财报披露的最新规模:**已签署10项协议,覆盖8家客户,最低合同收入939亿美元,附带165亿美元财务担保(现金存款和金融工具)。加权平均期限超过4年。** CFO透露,FY2027约50%的出货比特已通过NBM锁定,FY2028将升至约三分之二,“客户需求增速超过了我们的供应能力,比特分配将持续到2027年以后。” > 如果兑现,闪迪将从一家周期性极强的NAND批发商,变成有长期收入可见性的基础设施供应商——前提是这些协议在行业下行期也能执行。 ## 西部数据:GAAP利润的"水分",和89%的云端依赖 [西部数据](https://wallstreetcn.com/articles/3778787)Q4营收37.47亿美元,同比增长44%。non-GAAP毛利率54.4%,营业利润率44.2%,稀释每股收益3.56美元,同比增长109%,均高于预期。 **但这里有一个必须指出的细节。**GAAP口径下,Q4净利润31.95亿美元,同比增长1215%。这个数字经常被媒体标题引用,但它严重夸大了实际经营表现。原因: > 西部数据分拆后保留了部分闪迪股票,Q4闪迪股价大涨,这部分持股的市值重估产生了约20.5亿美元的账面收益。剔除后,non-GAAP净利润只有13.82亿美元。"净利暴增12倍"——需要打个大折扣。 **业务层面,西部数据分拆后是一家纯粹的HDD制造商。**Q4云端客户收入占总营收的89%,约33亿美元,同比增长43%。客户端收入占6%,消费类占5%。高度集中的客户结构是一把双刃剑:**需求可预测,但议价权几乎完全在客户手里。** CEO Irving Tan在电话会上反复论证AI对HDD需求的"结构性拉动":**训练产生数据,推理产生更多数据,而AI Agent在执行多步骤任务时,每一步都生成需要持久化存储的中间数据。“算力可以复用,但数据只会越攒越多。”** **产品端,40TB ePMR硬盘已开始出货,预计到FY2027 Q3贡献过半近线比特。**44TB HAMR计划2027年上半年量产,50TB瞄准下半年。公司正在谈覆盖2029至2031年的LTA。定价端,Q4每TB混合均价同比涨约17%(上季度仅高个位数),成本端每TB同比下降8%。量价齐升叠加成本下降,推动毛利率从一年前的41.3%升至54.4%。 ## 市场到底在怕什么? 2026年Q2(对应西部数据/闪迪的Q4 FY2026所在季度),存储行业交出了有史以来最疯狂的成绩单: > **三星电子:**季度营收171.5万亿韩元,同比增长130%;营业利润89.5万亿韩元,同比增长1814%。半导体部门贡献了全公司99%的利润。 > > **SK海力士:**季度营收79.3万亿韩元,同比增长257%;营业利润60.5万亿韩元,同比增长557%;净利润93.9万亿韩元。HBM(高带宽内存)出货量持续飙升,公司已与包括核心客户在内的十余家客户签订了长期供应协议(LTA)。 > > **美光科技:**Q3 FY2026(3-5月)营收414.6亿美元,同比增长345.7%;GAAP净利润282.4亿美元,同比增长1398.3%。 > > **铠侠:**Q1 FY2026(4-6月)营收1.77万亿日元,同比增长415.5%;净利润8422亿日元,同比暴增逾45倍。面向服务器的企业级SSD营收同比增长超440%。 > > **希捷科技:**Q4 FY2026营收36.29亿美元,non-GAAP毛利率52.7%,non-GAAP EPS 5.71美元。全年营收121.95亿美元,同比增长34%。 五家公司,全部创历史新高。驱动力高度一致: > 全球云厂商2026年资本开支合计预计超过8000亿美元(微软、谷歌、亚马逊、Meta等),AI训练和推理集群对存储的消耗远超预期。 > > TrendForce数据显示,2026年Q1 DRAM合约价环比暴涨93%至98%,NAND Flash合约价环比暴涨85%至90%。服务器DRAM需求占比首次超过50%,标志着存储需求的"主力军"已从手机转向数据中心。 但正是在集体狂欢的财报中,资本市场发出的信号却令人不安。 7月,SK海力士韩股最大回撤54%,三星电子42%,美光科技33%,闪迪单月暴跌47%(市值蒸发逾1500亿美元),费城半导体指数录得2008年以来最大单月跌幅。 这是市场对整个存储超级周期的持续性投下了不信任票。这里有两层解释。 **浅层是"利好出尽"。** 闪迪Q1 FY2027营收指引103亿至108亿美元,华尔街共识预期111.6亿美元——中值差了约6%。对一只年内涨幅一度超过400%的股票,**超预期只是及格线,不及预期就是踩踏。** 西部数据的指引其实高于预期——营收中值41亿美元 vs 预期40.2亿,EPS 3.85至4.15 vs 预期3.83——但这也不够。年内涨了近200%之后,**市场要的不是刚好超预期,而是能支撑下一个200%的上修信号。** **深层跟存储周期有关。** TrendForce预测2026年Q3 DRAM合约价环比涨13%至18%,NAND Flash涨10%至15%。**如果坐实,意味着涨价斜率从前几个季度动辄翻倍的节奏,掉到了中低双位数。** 杰富瑞7月28日的报告更悲观——认为Q3实际涨幅可能只有15%至20%,远低于此前预期的25%至30%,并警告"价格见顶可能早于预期"。 **消费端也在反噬。**OPPO和vivo已经拒绝接受三星的Q3报价,闪迪Q4消费类收入环比跌了32%。Goeckeler承认公司在"寻找价格和销量的平衡点"——涨到某个价位,需求就没了。 **更深一层,这轮周期虽由AI数据中心需求驱动,但定价已远远跑在实际业绩前面。** 闪迪全年non-GAAP净利润109.9亿美元,对应约2100亿市值,市盈率20倍出头,看起来不贵。但这是在NAND价格一年涨了5倍的基础上——稍有回调,利润缩水会非常剧烈。 [高盛]( ## **分家一年,两份财报,一个AI故事** 2025年2月21日,西部数据(Western Digital)完成了存储行业近十年来最重要的一次分拆:将旗下的NAND闪存业务剥离为独立上市公司——闪迪(SanDisk)。 分拆的逻辑并不难理解。HDD和NAND是两种完全不同的生意:前者是低增长、高现金流的"收租"模式,后者是高波动、重资本支出的周期性豪赌。2016年西部数据花190亿美元买下闪迪时,想的是垂直整合;到了2023年,在激进投资者Elliott Management的压力下,公司终于承认这桩婚姻并不幸福。 分拆时,市场给这两家公司贴上了截然不同的标签:**西部数据是"旧时代的遗物",是一家注定被SSD替代的HDD制造商;闪迪则是"AI时代的门票",手握NAND产能,剑指数据中心。** 实际上,西部数据和闪迪在同一个AI故事里扮演着两种角色。 闪迪冲在最前面,赚周期弹性的钱——上行时可以一个季度净赚69亿美元,下行时也可能转亏。西部数据守在后场,赚产能壁垒的钱——增速没闪迪猛(44% vs 372%),但利润的可预测性更强。 **两份财报的共同信号很明确:**AI对存储的需求远未到顶。但市场定价已经不跟基本面走了。**当一只股票年内涨了400%,"符合预期"就是利空,"略低于预期"就是踩踏。**整个AI硬件板块正在经历估值范式切换——从"跟AI沾边就值钱",进入"必须证明增长能持续超预期"的阶段。 **技术路线上,两家也在走向分岔。**闪迪押注HBF(高带宽闪存),8月3日刚与SK海力士联合发布OCP规范,试图用NAND补充HBM、切入AI推理市场。西部数据走确定性路线——用HAMR持续推高HDD容量天花板,40TB已出货,44TB在路上。前者上限更高、风险更大;后者更稳、但天花板也更清晰。 接下来几个季度的关键监测点:**Q3存储合约价的实际落地幅度(如TrendForce预测坐实,涨价见顶叙事将强化)、闪迪NBM协议的执行质量、西部数据HAMR量产进度。** 在一轮"业绩屡创新高、股价屡屡杀跌"的周期里,存储行业正在从"所有人都能赚到周期红利"的阶段,转向只有结构性壁垒才能持续创造价值的阶段。 风险提示及免责条款 市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
资讯同步's avatar
资讯同步 1 hour ago
#华尔街见闻 据伊朗方面5日消息,伊朗总统佩泽希齐扬说,目前与伊朗最高领袖穆杰塔巴联络“非常困难”,一些人利用穆杰塔巴的正常决策过程在伊朗内部制造分歧。佩泽希齐扬说,穆杰塔巴曾在决策过程中表示,尽管自己原则上持反对意见,但如果相关程序推进,他也会接受。然而,一些试图制造分裂的人却不断夸大问题的严重性,以推进符合自身利益的议程。 佩泽希齐扬说,穆杰塔巴最近收到相关委员会提交的一份报告后表示,如果报告中的方案获得四分之三票数支持,他将接受。最终,该方案获得绝大多数支持,他接受了。“在这种尊重专家意见并据此作出决策的过程中,却有一些人伺机制造分裂,散布不公正、不诚实的言论,企图抹黑他人形象。” 近期,有传闻称佩泽希齐扬与伊朗最高领袖、伊朗伊斯兰革命卫队存在分歧,称佩泽希齐扬可能辞职。伊朗总统办公室已多次辟谣。 (央视新闻)