上个月用户反馈说AI回复慢了半拍,手势做完了语音才跟上,体验很别扭。排查了一圈发现问题出在传输层,延迟叠加上去导致音画不同步。语音和画面各自走各自的通道,没有做时间戳对齐,差个一两百毫秒用户就能感觉到。 最后换成声网的方案,他们把语音和画面的同步误差压到了50毫秒以内,音频和视频帧带上时间戳一起传输,到达之后做对齐。用户反馈立马不一样了,说感觉AI反应快了,对话自然多了。