有个YC孵化的团队,做的事特别简单:帮语音AI客服"选模型",收点过路费。就靠这个,外部使用量每周涨25%。
先说背景。现在的AI语音客服,听着高大上,背后其实是三个AI模型拼起来的:一个把你的话转成文字(STT),一个负责思考怎么回(LLM),一个把答案说出来(TTS)。
每一层都有十几个供应商,而且几乎每个月都有新模型冒出来。
创始人Bek之前在一家东南亚语音客服公司当CTO,干了4年,被折磨疯了:每次新模型发布,公司都要雇母语评测员、盲测打分、重新集成、重新上线,跟做一个研发项目一样。
后来他发现这是全行业通病:大多数公司评测一次,选好一套模型组合,就再也不换了。因为换供应商意味着重新对接、重新评测,没人愿意开这个头。
结果就是:大家用着上个季度的模型,付着更贵的钱,市场上明明有更便宜更好的。
Bek把这套"选模型"的流程做成了一个API,叫Speko,人称"语音界的OpenRouter"。
客户只对接它一个API、一把Key、一张账单。发个请求,告诉它你要准、要快、还是要便宜,它就从自己的排行榜里挑出当下最合适的模型组合,把请求转给对应供应商。
那它怎么知道哪个模型最好?靠"持续评测",这是灵魂。
一是雇母语评测员做人工盲测,专测真实场景:随意口语、金额、日期、十分钟的通话。因为30秒听着好听的声音,不一定撑得过第8分钟。
二是拿历年盲测数据训练了个自动打分器,水平已经接近"另一个评测员"。
三是排行榜全公开,连自己选输的案例也照发。它不训练模型也不卖模型,所以敢说榜单中立。
数据有多反直觉?测了23个模型,11个只测过英语;9种语言里,4个不同的模型分别夺冠,根本没有"一个模型打天下"。大名鼎鼎的Deepgram Nova-3,听错词的比率高达9.8%,榜首只有2.0%。
名字最响的,真不一定是最好的。
那怎么赚钱?两套收费。
第一套,路由抽成:在供应商公开价上加收5%。比如某模型公开价每分钟0.006美元,客户通过它付0.0063美元,多出来的就是它的。
客户为啥愿意付这5%?因为自己选型的成本,雇评测员、做集成、冒换错的风险,远远不止5%。而且它会一直盯着新模型,出了更好的自动换,等于花5%买了个"永远用最新最好"的保险。
第二套,全托管一口价:每分钟0.09美元,三层全包,客户不用管底层用了谁。(推测)它赌的是三层实际成本平均低于0.09美元。为啥赌得赢?STT这一层最便宜0.001美元/分钟,最贵0.017美元,价差17倍,按目标选价就能套利;流量大了还能找上游谈批发折扣;对客户来说,一口价等于预算上限,不怕用户话痨聊一小时账单爆炸,这个确定性本身就值钱。
另外它的网关是开源的,支持客户自带API Key,流量完全不经过它,这是获客钩子,先把工具铺开,再升级托管。
有人质疑:业界都在做端到端语音模型,一个模型直接"听+想+说",你这三层拼装是不是要完?创始人很淡定:端到端的我们也测,谁赢就路由给谁;而且现在95%的生产环境还是三层拼装,企业要的是可组合、可观测、成本可控。
我最喜欢这故事的一点:他把公司内部重复了4年的最痛流程,直接做成了别人的付费产品。AI应用层越卷,这种中立的"选型、路由"层就越值钱。你公司里那个每周都在重复的麻烦事,可能就是下一个生意。
赚钱 人工智能 ai创业

