千山暮雪
美国财政部加码“救市”:为何市场不看好?美联储会参与吗?_我的网站

一 | 面对30年期美债收益率突破5.3%、创下19年高位,美国财政部选择干预,长端利率应声而落。但是,几个交易日后,首次干预的效果很快被市场消化,美债收益率快速反弹,美国财政部则再次释放“加码”干预的信号。 8月24日,美国财政部长贝森特再度确认,将于9月9日正式执行新一轮回购操作。

二 | 中国大模型独角兽月之暗面(Kimi)K3爆红,引发全球关注。 7月16日,月之暗面宣布推出2.8万亿参数的Kimi K3,成为全球参数最大的开源模型,瞬间震动全球——发布48小时后,用户请求量逼近集群承载极限。7月19日晚,月之暗面发布公告,暂停C端新用户订阅,将全部算力优先保障已付费老用户。 对于K3的影响力,美国媒体直言“美国在AI领域领先世界”这一认知被中国打破了。 外媒报道称,Kimi K3在成本和功能可定制化上对用户有着强烈吸引力,美国AI产业链需要投资过千亿美元建设数据中心来维持技术优势,许多投资者担心这些美国AI企业的估值是否过高,而Kimi K3的出现将给这些美国公司带来相当大的压力。

三 | 8月19日,贝森特宣布将长债回购规模翻倍。 澎湃新闻记者曾经到访过月之暗面的办公室,并遇到了CEO杨植麟本人——在清华到知春路地铁站的区域里,投资人王慧文曾说,他所有投资回报最高的公司都在这一片“豆腐块”区域里——从清华校门到知春路地铁站,字节的豆包、DeepSeek、月之暗面都诞生在这里。截至发稿,30年期、10年期美债收益率为5.237%、4.71%,其近期最高点分别为5.336%、4.746%。 美债收益率飙升对应着美债价格下跌。

四 | 在月之暗面,五位创始人全部毕业于清华大学,公司名字则来自平克·弗洛伊德的经典摇滚专辑《月之暗面》——公司成立当天,正好是这张专辑发布50周年。

五 | 这一轮中长期美债价格快速下跌释放了什么信号?美国财政部的“救市”行动能达成所愿吗?美联储会作何反应? “靠嘴”干预?会否动用TGA资金? 美国债券投资者正时刻关注着贝森特关于债市干预的信息。 8月19日,美国财政部宣布,在9月9日至11月4日期间,将单次长期国债回购规模上限从20亿美元至少翻倍至40亿美元。 这种摇滚气质贯穿在公司细节里:所有会议室都以摇滚乐队命名。仅仅一天后,贝森特在接受CNBC采访时进一步强化了其“干预主义”立场,称40亿美元并非“硬约束”,必要时上限可继续上调。有一个会议室叫“Splay”,外人以为是某个不知名乐队,其实是两位联合创始人杨植麟、周昕宇在清华上学时组的乐队名字,这个名字还来自数据结构里的伸展树算法。

六 | “不管是C端用户还是B端客户,Kimi现在都处于供不应求的阶段。8月24日,贝森特重申了这一计划,并强调将继续执行常规国债标售。”月之暗面企业业务负责人黄震昕在接受媒体采访时表示。 目前,市场正高度关注财政部是否会动用其手头约9500亿美元的财政部一般账户(TGA)资金来支持回购。

七 | 财政部一般账户(TGA)本质上是联邦政府的支票账户,用于支付政府日常运作费用,例如联邦雇员工资、国防合同以及财政部的利息和本金债务。截至上周三,其余额约为9500亿美元。中金公司表示,从机制上看,财政部回购长债不能无限制消耗TGA;若TGA资金消耗殆尽,则仍需要通过增发短债弥补资金缺口,虽可改变美债期限结构,但对收益率的实质影响或有限。 K3最大的变化,是质变 “它不是靠后天很多技能学习或者打磨出来的强模型,是一个原生就非常聪明的模型。”黄震昕介绍,Kimi K3最核心的特点是长时程高难度推理能力。 华泰证券分析师易恒指出,距离8月3日财政部上调三季度再融资规模至7390亿美元仅过去16天,此次回购调整显得颇为仓促,缺乏计划性,且截止日设定在2026年中期选举后一天,难免引发市场对其政治动机的猜测。 现场展示的几个案例印证了这一点:非技术人员用一句话,就能复刻出童年玩过的、已经停更的游戏,还原度达到90%;输入20篇商业航天领域的研报,一句话就能生成图文并茂的深度研究报告,所有图表实时生成,还包含周期传导链、竞争格局等专业分析;复杂的芯片设计工作,现在也能通过K3完成。 大模型行业过去信奉Scaling Law——算力、训练数据、参数量三个维度同时放大,模型性能就会提升。此外,贝森特主导下的美国财政部干预带有较强博弈与投机色彩,常在长债收益率上行时点出手,但实际投入规模有限,主要依靠信号扰动市场;若市场看穿这套模式,财政部公信力将受损。 长期美债收益率为何飙升 华尔街知名投资人Stanley Druckenmiller在《华尔街日报》发表署名文章指出,30年期美债收益率冲高是高赤字、通胀持续超标、充分就业环境下市场的客观定价。当前美债市场并未出现拍卖失败、交易失灵等流动性危机,美国财政部动用流动性工具干预市场,偏离了其定位,实质是对利率水平的直接干预。但这条定律正在撞上墙:算力投入扩大100倍,模型才能获得10倍的增强,全球算力已经开始紧缺,高质量训练数据也基本见底。

八 | 月之暗面的解法是换掉Transformer架构中8到11年没有更新过的核心组件。 换言之,美国财政部的干预并未对症下药,它无法改变长期收益率飙升背后的多重结构性因素:美国经济增长持续高于趋势水平、通胀长期高于政策目标、AI繁荣带来的巨额融资需求,以及中东地缘局势紧张等。 Druckenmiller认为,流动性工具无法化解财政基本面矛盾,只能延后问题,难以扭转利率走势。三项底层技术成为K3的核心支撑: 第一项是名为MuonClip的新型二阶优化器,首次应用在万亿参数大模型训练中。 据华泰测算,受关税退税、新增军费及大美丽法案财政宽松影响,2026年财政赤字率可能维持在6%左右的高位,政府债务占GDP比例难以下降。它能让20T的训练数据发挥出40T的效果,同样性能下训练成本和算力功耗直接减半。

九 | DeepSeek已经认可并采用了这项技术。 第二项是自研的KDA混合线性注意力机制,解决了传统线性注意力在长距离任务上性能衰减的问题。 中金公司认为,扩大长债回购对美债供需格局的直接影响相对有限,更多发挥稳定市场预期的信号作用。传统全注意力机制的计算量随上下文长度平方增长,到百万Token级别成本极高,而KDA让模型规模扩大10倍时成本仅扩大10倍,Scaling Law得以继续延伸。这也是K3支持100万Token上下文的基础——足够装下一整本长篇小说,或者一个完整项目的全部代码。

十 | 财政部无法像美联储一样直接创造准备金,若进一步扩大回购,资金仍需通过融资获得,可能主要通过增发短债来弥补,进而改变美债期限结构,类似于美联储过去的“扭曲操作”。

十一 | 贝森特与沃什:“合流”还是“分化” 除了贝森特,决定美债走向的还有另一位重要人物——美国货币政策主导者美联储主席沃什。 第三项是Attention Residuals(注意力残差)技术,今年3月月之暗面发布相关论文时,马斯克就曾在X平台转发评价“Impressive”。 当前,两位美国重量级官员各有各的烦恼。如果说贝森特的烦恼是国债收益率太高了,那么沃什的烦恼就是通胀水平太高了。两人均面临各自的信誉风险,谁能帮得了谁? 中金公司表示,美国财政部的回购能够在一定程度上改善长债供需和市场流动性,但要真正压低长端利率,关键仍在于改善投资者对美国财政和货币政策的预期。这项技术以不到2%的额外计算成本,实现了25%的训练效率提升。论文一作中有一位17岁的实习生。 东吴证券认为,近期美债长端收益率上行,一方面受到美国财政赤字、长债供给以及AI企业发债等因素影响,另一方面,沃什对美联储通胀框架的调整及政策沟通方式,也加剧了市场对美联储抗通胀信誉的担忧,进一步推高期限溢价。 “真正懂行的人都知道,这一代模型的能力提升不可能靠蒸馏来。 东吴证券进一步指出,更关键的是,当前的基本面并不支持压低利率。历史上,QE或“扭曲操作”均用于经济衰退或通缩时期。而当下美国经济过热、通胀高企,人为压低无风险利率等同于实施变相货币宽松,与沃什试图控制的加息前置逻辑背道而驰。 8月28日,沃什将在杰克逊霍尔全球央行年会上发表讲话。 中金公司指出,沃什若继续回避清晰指引,对稳定预期帮助有限。面对两难境地,较好的选择是坚持对控制通胀的承诺、不再说“市场利率高就等于加息”,同时承诺在利率危机时提供流动性支持。”针对外界关于蒸馏的质疑,黄震昕打了个比方表示,“六耳猕猴和真孙悟空,终究还是不一样的。”他提到,OpenAI的战略负责人也曾在X上表示,这么聪明的模型不可能通过蒸馏得到。

十二 | 大公国际分析师则表示,相较简单的鹰鸽信号,市场更关注沃什就美联储与财政部的政策边界、协同规则释放的表态。即便讲话释放鸽派信号,长端美债收益率也只会迎来短暂情绪回调,财政赤字、国债供给以及期限溢价等结构性因素会约束收益率趋势下行,利率实质性回落仍要看财政端能否改善。 回应马斯克:希望“掰一掰手腕” 马斯克是K3最受关注的观众之一。若7月PCE通胀并未大幅偏离市场预期,本次讲话对美债市场的影响权重将高于单月通胀数据。 K3发布当天,在FrontendCodeArena前端编程榜单上,K3以1679分登顶,成为首个在该榜单超越所有闭源模型的开源模型。马斯克在相关报道下留言:Impressive。这是他今年第二次公开肯定月之暗面的技术。

十三 |
(文章来源:澎湃新闻)。
但仅仅一天后,马斯克就在X上放话,自家正在训练的Grok新模型可能会超越Kimi。
月之暗面的官方回应是:“欢迎加入2万亿俱乐部。”黄震昕在现场补充了一句:“我们拭目以待,希望他们出来跟我们掰一掰手腕。他有信心,我们有更强的信心。

十四 | ” 马斯克的回应,代表了全球市场对Kimi K3实力的认可。外媒报道,自深度求索(DeepSeek)推出R1版本以来,中国的AI模型持续影响着整个行业。它们在一定程度上颠覆了由西方头部企业确立的AI产业的经济基础,即付费闭源模式。 据外媒分析,中国企业的AI模型在服务定价方面低于美国竞品。根据基准测试网站人工智能分析网的数据,使用Kimi 2.6或DeepSeek-V4-Flash执行标准化智能任务的加权平均成本介于0.33美元至0.02美元之间,而Anthropic的Claude Fable 5执行同类任务需花费2.75美元。在上述任务中,Kimi K3的预估使用成本为0.95美元。

十五 | 另有外媒称,过去18个月里,中国科技企业陆续推出一些性能接近美国对手、所需算力资源更少的开源AI模型。性能强、成本低的组合使中国AI模型成为全球众多开发者的优先选择。 开源是月之暗面从成立之初就坚持的路线,“过去大家总觉得开源模型就要卖得便宜,中国模型就要打价格战。

十六 | ”黄震昕表示,“K3现在在全球都供不应求,我们没有走低价路线,就是想告诉全世界,开源模型、中国模型也能做出SOTA级别的产品,也能获得合理的商业回报。” 他明确表示,Kimi不会陷入价格战。目前K3的推理分三档,用户可以根据需求选择。 今年以来Agent(智能体)赛道火热,不少模型公司开始转型做应用,月之暗面始终坚持在基模路线上。 “模型公司一定要做模型。”这句话似乎听起来像废话,但月之暗面的判断是,模型强度是所有上层应用的基础——Agent、C端产品、B端服务,都是模型能力强到一定程度之后自然发生的事,“模型做的足够强,你说什么都是对的,用户自然会来用。” 这并不意味着他们不做应用,KimiPPT已经是C端最好的AI生成PPT产品之一,这些C端Agent能力正在反哺基模迭代。 “海外最好的模型为什么强?因为他们会根据最终应用反过来调模型,而不是根据模型能力去做应用。

十七 | ”在月之暗面看来,这叫做“模硬一体”——通过C端产品的真实使用数据,反过来优化模型,让模型能力和用户期望真正对齐。 接下来,月之暗面还会推出Kimi Hosting Agent平台,把内部打磨成熟的Agent能力(比如PPT生成、研报生成)通过API开放给B端客户,媒体可以直接接入内部系统做PPT,投研机构可以直接搭建自己的研报系统,用户还可以自定义风格。 商业化方面,黄震昕透露,目前C端收入占比达到70%,公司不做私有化部署服务,坚持SaaS模式。具体的收入结构、与海外闭源模型的差距、国产算力使用比例、自研芯片计划等问题,大方向上,会尽可能使用更多国产算力。

十八 | 关于幻觉问题,黄震昕坦言无法完全杜绝——幻觉是模型创造力的来源,很难彻底消灭,但模型越强幻觉率越低。

十九 | K3已经是幻觉非常少的模型,内部通过AgentSwarm技术解决:一个Agent负责写内容,专门有一个事实校验员Agent核对所有数据,用户如果在prompt中加上“引用信源必须全部来自官方权威来源”,幻觉率会大幅降低。 “我们长期在三个方向投入:长上下文决定模型能干活的时长,训练效率决定模型有多聪明,Agent协作决定复杂任务怎么完成。”黄震昕表示,这三个方向,未来五年还会继续投入。

| Kimi的愿景是“找到将能源转化为智能的最优解”。在他看来,这件事有三个层面:首先要做最强的模型,就像登月一定要做到最好;其次要通过底层算法创新,在有限算力下做出最强模型;最终要让AGI普惠全世界。

| 面对紧缺算力,据了解,月之暗面正在全力采购和部署新的算力,优先保障老用户体验,黄震昕表示,新的算力到位后,订阅会逐步开放。但可以确定的是,参数会继续越做越大。 北京邮电大学数字媒体与设计艺术学院副教授谭剑告诉澎湃新闻记者,全球AI的核心团队甚至引领者,相当一批出自清华姚班。一个班,750个人,硅谷和北京两头都是他们的人。

| 这说明美国AI的底子本来就是全世界最聪明的一群脑子堆出来的,而这群脑子里有很大一块,根子在中国的数理教育。脑子会走路,这是这场竞赛里最大的变量。 “K3的爆火,是国产大模型真正站上全球第一梯队的标志性事件。它不是靠堆算力、堆参数的蛮力,更不是靠蒸馏模仿的跟随品——三项底层架构创新,直接改写Transformer诞生十余年来未变的核心组件,让Scaling Law在全球算力瓶颈下得以延续。

| ”人工智能专家、天使投资人郭涛表示,中国AI不再是硅谷的追随者,而是正在长出真正能定义行业方向的原始创新力量。

|
Current article:http://www.bianhajieleigoukusunmen.pics/k1gelk/20260826/4582.pptx
Published on:06:57:12










