#Kimi K3 受益
估值 110 亿法律 AI 弃闭源,转投中国开源底座
WooFun2026-08-25 21:29
核心要点
Harvey发布自有模型Tenet,基于月之暗面Kimi K3。通过两个月、150张B300显卡的后训练,其在法律长程任务中表现显著提升,验证了垂直行业利用开放权重构建专有能力的可行性。
据 Woofun AI 消息,OpenAI 投资的法律 AI 独角兽 Harvey 正式推出其首个自有模型 Tenet,该模型并未沿用传统的闭源 API 路线,而是选择以月之暗面于 7 月开放权重的 Kimi K3 作为技术底座。
这一决策标志着全球估值最高的法律 AI 公司在核心能力构建上发生了根本性转向,从依赖外部黑盒接口转向基于开放权重进行深度定制与后训练,旨在将验证过的专业能力逐步整合进其核心产品体系中。Harvey 的这一举动不仅揭示了垂直行业对模型控制权日益增长的需求,也重新定义了基础模型与下游应用之间的价值分配逻辑,Tenet 目前仍处于研究预览阶段,但其背后的技术路径选择已引发行业广泛关注。Harvey 成立于 2022 年,短短数年间便迅速崛起,当前估值高达 110 亿美元,稳居全球法律 AI 领域估值榜首。
其股东阵容堪称豪华,包括红杉资本、a16z 以及新加坡政府投资公司 GIC 等顶级机构,这为其提供了充足的资本支持以进行高强度的技术研发与市场扩张。公司创始团队兼具深厚的法律实务背景与前沿的人工智能研究经验,其中联合创始人 Winston Weinberg 此前是知名律所 O'Melveny & Myers 的诉讼律师,对法律行业的痛点有着深刻理解;另一位联合创始人 Gabe Pereyra 则曾在 Google Brain 和 Meta 从事大模型研究,具备顶尖的技术视野。
这种跨界组合使得 Harvey 能够精准地将 AI 技术应用于复杂的法律场景中,OpenAI 作为早期投资者,不仅提供了资金支持,更在技术层面与 Harvey 建立了紧密的合作关系,双方曾共同训练过一套专门针对案例法的模型,将约 100 亿 token 的美国案例法数据纳入训练集,这一合作案例曾被 OpenAI 作为典型客户故事广泛传播。在过去几年中,Harvey 几乎一直是闭源模型在专业服务行业最典型的应用案例,其业务高度依赖于调用全球最强的一批闭源模型,通过提示词工程、检索增强生成以及智能体编排等方式来提升服务效率。
然而,随着业务规模的扩大和对服务质量要求的提高,Harvey 逐渐意识到仅靠调用外部 API 存在局限性,尤其是在数据隐私、模型可控性以及定制化能力方面。因此,当 Harvey 第一次决定将自己的法律任务、律师的评分标准以及两个月的算力真正写入一套模型权重时,它面临着一个关键选择:是继续依赖闭源模型的微调接口,还是转向开放权重模型进行深度后训练。最终,Harvey 选择了后者,并选中了来自中国的开放权重模型 Kimi K3 作为底座,这一决定打破了以往垂直行业对闭源模型的依赖惯性,开启了新的技术范式。行业范式的转变源于开放权重与闭源 API 在训练逻辑上的本质差异。在闭源 API 占主导的时代,模型公司完成预训练和后训练后,将能力封装成接口提供给下游企业,用户只能在此基础上进行提示词优化、检索增强或智能体搭建,很难对模型本身进行实质性改变。
这种模式下,模型的能力在交付给用户时已基本定型,后续的提升空间有限。然而,开放权重打破了这一前提,企业拿到模型权重后,可以将其与自己的专有数据和专家反馈相结合,将真实任务和评价标准直接带入训练过程。
这意味着,即使是发布时性能相近的两个模型,在经过同一批数据和算力的继续训练后,最终表现可能出现巨大差异。例如,一个模型可能最终停在 91 分,而另一个则可以达到 97 分,对于准备投入数月时间、算力和专家资源的公司来说,这种初始性能的微小差距经过后训练放大后,将成为决定性的竞争优势。因此,选择一套值得训练的开放权重底座变得至关重要,这不仅要求模型在通用能力上具备竞争力,更要求其在专业场景下具备足够的潜力和可塑性,能够承受高强度的后训练并实现性能的显著提升。Kimi K3 的技术规格使其成为 Harvey 的理想选择,其总参数达到 2.8 万亿,支持 100 万 token 的上下文窗口,在长程任务、工具使用和复杂推理方面展现出强大的基础能力。
这一性能水平使其首次进入可以与前沿闭源模型相提并论的评估范围,不再仅仅被视为成本更低或控制权更多的备选方案。Harvey 在评估过程中关注的一个核心问题是,这套权重是否易于进行后续训练,这一判断逻辑与 Cursor 和 Cognition 等其他头部 AI 公司的选择高度一致。Cursor 在训练其编程智能体 Composer 2 时,并未单纯依据常见的编程智能体榜单来选择模型,而是认为智能体和长程任务能力会在强化学习过程中发生显著变化,训练前的排名未必能预测最终结果。
因此,Cursor 更看重模型的编程知识储备、状态追踪能力、在内部代码库上的困惑度以及在自家基础设施中的运行效率,最终选择了 Kimi K2.5 作为底座。同样,Devin 背后的 Cognition 也持有相同观点,在 Kimi K3 开放权重后,迅速将其接入 Devin Desktop 和 CLI,并在自家的 FrontierCode 1.1 Extended 测试中取得了 58.2% 的分数和 63.6% 的通过率。
该测试考察的是真实工程任务,包括代码能否合入主干以及质量是否达标,Cognition 特别指出,K3 在复现 bug 和管理运行环境方面表现优异,这两点正是长程编程任务中最容易出错的环节,随后 Cognition 也基于这套权重进行了后训练,进一步验证了 Kimi 系列模型在垂直领域的可训练性。Harvey 的业务增长为其积累了大量宝贵的行业数据,今年 3 月,其服务客户约为 1300 家机构和超过 10 万名律师,短短五个月后,客户数量几乎翻倍,覆盖范围扩展至 70 个国家,AmLaw 100 中超过四分之三的律所已成为其用户。
法律服务具有高金额、低容错的特点,例如在并购尽职调查中,模型需要从成千上万份文件中识别控制权变更条款,判断交易触发条件,并评估风险,这一过程涉及数十个连续判断,任何遗漏都可能导致严重后果。随着服务规模的扩大,Harvey 积累了大量基础模型公司难以获取的数据,包括律师如何布置工作以及合伙人如何评估结果,这些经验被转化为 Legal Agent Benchmark,其中包含超过 1200 个长程法律任务,覆盖 24 个执业领域。
每个任务的说明平均仅约 50 个词,模型需在封闭的客户事项环境中自主搜索、阅读、判断并提交成果,每项任务平均有约 50 条评分标准,复杂任务可达数百条,涵盖事实查找、结论成立性、引用准确性及风险建议合理性等维度,任务最长可持续超过 1000 轮,消耗数十万 token,这种精细化的评价体系使得模型的工作过程变得可计算、可比较,为后训练提供了高质量的反馈信号。
在训练工程细节方面,Harvey 采用了组序列策略优化(GSPO),让模型在同一任务上生成多种做法,并根据结果质量差异更新权重,当两条轨迹得分接近时,系统会重新评分以减少噪声影响。整个训练过程持续约两个月,使用约 150 张 NVIDIA B300 显卡,虽然相比预训练前沿模型所需的上万张显卡而言算力投入较小,但对于垂直行业后训练而言已属大规模。Harvey 采用 rank-64 LoRA 技术,覆盖 Kimi K3 的注意力层、前馈网络和路由专家权重,涉及约 50 万个专家张量。
长轨迹训练面临的一大工程挑战是模型状态的一致性,由于法律任务可能持续数百轮,训练端权重更新时,执行端仍在生成轨迹,若两者状态不对齐,奖励将无法准确作用于原始决策。Kimi K3 的混合专家结构加剧了这一复杂性,每个 token 进入模型后,路由器会从 896 个专家中选择 16 个参与计算,训练端和执行端在数值精度或批处理方式上的细微差异可能导致同一 token 被分配给不同专家,从而无法复现原始轨迹。
为此,Harvey 与供应商在内核层进行了数值对齐,权重更新后直接热加载至执行环境,无需中断任务生成,并记录 token 对应的专家路由结果,确保训练器重新计算时能回到原始路径,这一技术突破使得 Tenet 的训练流程得以稳定运行。模型性能评估结果显示,Tenet 在内部基准测试中表现优异,采用严格的 all-pass 口径,即任务中的关键评分标准必须全部通过。
在未参与训练的 LAB 保留集上,Tenet 完整完成的任务数量接近原始 Kimi K3 的两倍,all-pass 率从约 11% 提升至 19.7%,增加约 9 个百分点。在专门测试合同起草、审查和谈判的 LAB Contracts 中,完成任务数量增加约 20%,all-pass 率达到 11.3%,提高约 2 个百分点,Tenet 在 LAB Contracts 中排名第一,在完整 LAB 中排名第二。
此外,Tenet 在外部测试 Mercor 的 APEX Agents Corporate Law 和 Crosby 的 Redline Bench 中也表现出色,尽管未接触过这些测试的训练数据,其成绩仍明显高于原始 Kimi K3,证明了能力的迁移性。在 LegalBench、CUAD 和 MAUD 等通用基准上,Tenet 未出现明显退步,在 Scale Professional Reasoning Benchmark 的困难子集中,得分甚至从 36.0% 小幅升至 36.8%,表明专业后训练并未导致显著的能力遗忘。从战略意义来看,Harvey 早在 2025 年就开始采用多模型策略,持续接入 OpenAI 和 Anthropic 的新模型,但 Tenet 的推出使其首次拥有一套由自己训练、自己控制的开放权重模型。
这一转变的核心在于控制权,Harvey 可以通过 API 调用 GPT 和 Claude,但无法将 1750 个法律任务环境和律师的评价标准写入这些闭源模型,而开放权重允许其自主决定训练方式、奖励设计,并将专业能力保留在自有权重中。Kimi K3 的稳定性验证了长轨迹强化学习的可行性,混合专家路由的准确复现以及专业能力提升后未出现显著能力遗忘,且推理成本控制在生产可用范围内,这些结果比"开放权重"本身更具价值,证明了企业通过下载权重并进行后训练,确实能够留下实质性能力,值得继续投入算力、数据和专家时间。
未来展望方面,垂直行业后训练市场正在形成,Kimi 的生态价值日益凸显。Cursor 在编程领域训练出 Composer 2,Cognition 在同一套权重上继续训练了 Devin 用的模型,Harvey 则在法律领域做出了 Tenet,尽管编程和法律相距甚远,但都选择从 Kimi 已训练好的通用能力出发,注入各自的专业知识。
Tenet 的成功案例降低了行业门槛,两个月、约 150 张显卡以及一套由执业律师定义的评价标准,即可将通用权重推至行业前沿,算力门槛下降了一个数量级,而更难复制的部分在于对专业工作完成标准的清晰定义。软件开发和法律仅是开端,金融、咨询、医药、会计等万亿美元规模的知识工作市场,其头部公司虽未必自行预训练基础模型,但越来越有条件在成熟权重上训练专属模型。
如果这一路径持续成立,Kimi 面对的市场将不再局限于调用量,而是取决于有多少公司选择在 Kimi 上训练自己的模型,Harvey、Cursor 和 Devin 之后的跟随者数量将成为关键观察指标,这标志着 AI 产业从通用模型竞争转向垂直能力构建的新阶段。
评论
暂无评论