代码写得太快,验证跟不上了
Blacksmith 一年内估值从 6000 万美元涨到 5.5 亿美元,客户从 700 家涨到 5000 家。资本在为「一个问题」买单,还是在为一个「答案」买单?这是本文想弄清楚的事。
先说新闻。AI 代码测试初创公司 Blacksmith,不到一年,估值从 6000 万美元飙到 5.5 亿美元,接近十倍;客户从 700 多家涨到 5000 多家;团队只有三十来号人,年化收入已经做到数千万美元。B 轮由 Peak XV Partners 领投,GV 和 Y Combinator 继续跟投。数字很扎眼,也很容易让人头脑发热。
但我这人有个毛病——越漂亮的数字,我越要拆开看看。仔细一读就发现,估值翻十倍,收入却只给个"数千万美元"的模糊区间,官方死活不肯披露确切的 ARR。客户涨了七倍,人均年支出却不透明。把关键数字摊开来对比一下:
- 估值:6000 万美元 → 5.5 亿美元,约 ×9
- 客户:700 余家 → 5000 余家,约 ×7
- 团队:约 10 人 → 约 30 人,×3
- 年化收入:约 1000 万美元 → "数千万美元",未披露
换句话说,市场买的是预期,买的还没到手的成绩单。这跟我以前聊过的很多"风口"长得一模一样:故事很性感,数据很模糊。
很多人张嘴就说"这是新赛道"。我觉得这个判断有道理,但"新"得拆成两层:问题是新的,答案未必新。
第一层,量变引发了质变。过去写软件,人写多少代码,人就测多少代码,供给和质量大致可控。可现在呢?Cursor、Codex、Claude Code 一上手,代码生成近乎无限供给。验证需求一下子从"线性"蹦成"超线性"。历史上头一回出现"代码产出速度远超人工验证能力"的场景——这确实是全新的问题,不是老问题的复读。
第二层,角色变了。以前的测试工具是帮人测,AI 测试真正被期待的是替人测,而且能自动修。从"发现问题"到"修复问题",能力边界完全不同。Blacksmith 自己的演进也印证了这点:它最初只是做 CI 云服务,后来才长了 Codesmith 这个 AI 助手,专门修失败的检查。
第三层,付钱的逻辑变了。过去测试是成本中心,预算怎么省怎么来;现在 AI 测试是被 AI 编程速度倒逼出来的刚需,企业愿意为"跟上速度、别翻车"掏钱。从"省钱"到"追赶",动机一换,资本给高倍数的底气就来了。
好的,吹完彩虹屁,轮到我泼冷水了。越是"新赛道",往往越意味着格局没定、巨头还没进场。对 Blacksmith 这类公司,我最担心的三件事:
第一,巨头内置化。GitHub Actions 是微软自带的默认 CI,近乎免费、零迁移成本;Cursor、Codex 这些 AI 编程工具本身,正一门心思往验证能力里塞功能;AWS、Azure、GCP 三家云厂商,随时可能把 AI 代码测试做成云服务,顺手捆进账单里。当同样能力变成免费的基础设施,独立玩家的议价空间一夜之间就没了。
第二,收入跟估值节奏对不上。估值涨了近十倍,收入连个确切数字都不给。两条曲线的节奏明显不同步,这是最该盯的信号,也是泡沫期最容易糊弄过去的信号。
第三,护城河还没被验证。创始人自己都承认,Blacksmith 现在靠的是速度和性价比。这是云计算早期中间层公司用滥了的打法。这套打法能不能在巨头入场之前,沉淀出数据壁垒和用户粘性?现在没人知道。
「AI 代码测试」作为赛道定义,是真的新、也有想象空间;可单个公司能不能把新赛道变成自己的地盘,得盯三个观察点:下一轮敢不敢公布确切 ARR 和留存率;巨头多久进场;以及这家公司能不能在窗口期把数据飞轮转起来。
5.5 亿美元买的是「AI 时代验证成为瓶颈」这个正确的问题。而答案成不成立,市场和资本都还在等下一份关于收入和留存的数据。
最后说句实在的,同样的信息,站在不同位置,想的完全不是一回事。你是投资人,押的不是"赛道对不对",而是"这家公司能不能在巨头进场前把数据飞轮转起来"。你是创业者,切入姿势该是“比巨头更懂垂直场景”,而不是去做巨头明天就能免费抄的功能。你是开发者或团队,现在用这类工具就划算,它实打实帮你跟上 AI 编程的速度——至于它是不是下一个 Datadog,关你什么事,你先把活干完。