
修改代码:
elif args.audio_encode_mode == \’stream\’:
cached_audio_length_sum = sample_rate * cached_audio_duration
audio_end_idx = cached_audio_duration * tgt_fps
audio_start_idx = audio_end_idx – frame_num
all_L = len(human_speech_array_all)
human_speech_array_slice_len = slice_len * sample_rate // tgt_fps
pad_len = human_speech_array_slice_len – (all_L % human_speech_array_slice_len) if all_L % human_speech_array_slice_len != 0 else 0
if pad_len > 0 and pad_len<12000:
human_speech_array_all = np.concatenate(







