今年上半年大家聊大模型,主要还是在比谁更聪明。谁的推理跑分高、谁的 Benchmark 又刷新了、谁又发了千亿参数旗舰。
但到了下半年,身边真正在做 Agent、做 MCP 工作流的人,聊的东西开始变了。
不是不在意模型能力了,主要是大家发现,当 AI 从"你问一句我答一句",变成需要连续干活儿的时候,选型标准会跟着变。
原因很朴素:Agent不是聊天。
一个真实的 Agent工作流里,模型可能要先读取信息、做判断、调用工具、看返回结果、修正判断,然后继续下一步。一个任务拆下来,背后是几十次、甚至上百次的API调用。
这时候你突然发现,单次响应慢一点,乘上几十次,就是肉眼可见的卡顿。每次调用贵一点,一个月下来,Token 账单可能比你想象中吓人得多。
上个月底拉了一下账单,不看不知道。跑的任务也不复杂,就是让 Agent 自己循环处理数据,结果调用次数远超预期。再多跑几轮,钱包真顶不住啊!








