Latency(延迟)
Latency
从提问到得到回应之间的等待时间。语音对话要自然,这个数字得降到接近人类反应速度。
简单来说
延迟是指发出请求到响应开始返回之间的等待时间。这是决定AI产品体验好坏的关键指标,尤其是语音对话,只有延迟接近人类对话的反应速度(0.2~0.3秒)才会显得自然。
"更聪明"和"更快"是相互拉扯的两股力量——像推理模型那样思考得越久确实会更聪明,但也会更慢。所以各公司会同时推出快速的小模型和深度思考的大模型,而新芯片发布时通常也会拿"延迟降低了多少"来做卖点。
相关词条
出现过这个词的报道
目前还没有报道用到这个词。有新报道时会自动出现在这里。