大模型产品化的奇技淫巧~大模型现在偶尔还是会有响应缓慢的时候。这对语音智能体来说很难受,一次通话通常包含二三十轮交互,即使单次请求只有 1% 的概率严重超时,25 轮通话中至少遇到一次的概率也约为 22%。
于是这篇文章:engineering.myhoai.com/posts/a-simple-fix-for-llm-tail-latency/ 提出了一个解决办法:发两次请求,只用回复快的那一次。。效果比用更贵、更快的api要好很多。

大模型产品化的奇技淫巧~大模型现在偶尔还是会有响应缓慢的时候。这对语音智能体来说很难受,一次通话通常包含二三十轮交互,即使单次请求只有 1% 的概率严重超时,25 轮通话中至少遇到一次的概率也约为 22%。
于是这篇文章:engineering.myhoai.com/posts/a-simple-fix-for-llm-tail-latency/ 提出了一个解决办法:发两次请求,只用回复快的那一次。。效果比用更贵、更快的api要好很多。
