欢迎光临
我们一直在努力

最强免费分说话人语音识别工具,支持批量音视频识别转字幕,字幕翻译内容总结软件

本软件是一款基于 Qwen3-ASR-1.7B 大模型的本地音视频语音识别工具,配备说话人分离功能,可在个人电脑上实现:

  • 批量音频/视频转文字
  • 自动区分说话人
  • 导出带时间轴的 TXT / SRT / 字幕文件
  • 可选 AI 翻译(双语字幕)
  • 可选 AI 内容总结(摘要 / 核心结论 / 待办事项)

整个流程通过简洁的 Gradio Web 界面 操作,点击按钮即可完成识别与导出。

最强分说话人语音识别工具,支持批量音视频识别转字幕,字幕翻译内容总结


主要功能特点

1. 单文件识别与批量识别

  • 单文件上传:支持上传 .wav、.mp3、.flac、.ogg、.m4a、.aac 等音频,以及 .mp4、.avi、.mov、.mkv、.flv 等视频文件。
  • 文件夹批量处理:只需输入包含音视频文件的文件夹路径,软件会自动遍历并批量识别,结果按源文件名同名保存。

2. 说话人分离

对音频中的不同说话人进行自动区分,后续导出结果中会以 speaker0、speaker1 等形式标记。

3. 多格式导出

导出格式文件位置是否含说话人说明
.txt output/ ✅ 是 纯文本,按说话人标记,例如 speaker0: 你好
.srt output/ ❌ 否 标准字幕文件,不带说话人标记
.bilingual.srt output/ ❌ 否 启用翻译后生成的双语字幕
.summary.txt output/ 启用 AI 总结后生成的内容摘要

4. AI 翻译(双语字幕)

  • 勾选“启用翻译”后,字幕会被翻译。
  • 支持输出双语字幕,原文与译文上下两行显示。
  • 需要填写 API Key、Model Name 和 Base URL,点击获取API KEY>>

5. AI 自动总结

  • 勾选“启用 AI 自动总结”后,软件会调用 AI 对识别文本生成结构化总结。
  • 总结内容包括但不限于:
    • 摘要
    • 核心结论
    • 待办事项
  • 同样需要配置 API Key。

6. 配置自动保存

点击“开始识别”按钮时,当前界面的所有设置(语言、API 参数、翻译/总结开关等)会自动保存,下次启动时自动恢复。

7. 自动精度选择

软件会自动检测显卡能力:

  • 支持 bf16 时使用 bf16
  • 不支持 bf16 时使用 fp16
  • 无显卡时回退到 CPU / fp32

使用说明

1. 环境要求

  • windows 10 或 11系统
  • 推荐 NVIDIA 显卡显存不低于6G并安装最新驱动

2. 启动软件

首先将网盘内的软件压缩包下载到本地电脑并解压,然后双击启动软件.bat

启动后会自动打开浏览器,进入 Gradio 操作界面(默认地址:http://127.0.0.1:7860)。

3. 界面操作步骤

  • 选择输入方式:
    • 单文件上传:直接拖拽或选择音视频文件
    • 文件夹批量处理:填写包含音视频文件的文件夹路径
  • 设置识别语言:
    • 在“ASR 识别语言”中选择自动识别或指定语言(如中文、英文、日语等)
  • 配置 API(如需翻译/总结):
    • 填写 API Key
    • 填写 Model Name(如 deepseek-v4-flash)
    • 填写 Base URL(如 https://api.modelverse.cn/v1/)
    • 可点击注册链接获取 API 密钥
  • 启用附加功能:
    • 勾选“启用翻译”输出双语字幕
    • 勾选“启用 AI 自动总结”输出内容摘要
  • 点击“开始识别”:
    • 软件会自动保存当前设置
    • 在日志区域显示处理进度
    • 在“识别预览”和“AI 总结”标签页查看结果
  • 4. 查看结果

    识别完成后,结果文件保存在:

    • output/ 目录:.txt、.srt、.bilingual.srt、.summary.txt

    输出文件说明

    1. TXT 文本文件(带说话人)

    示例:

    复制

    speaker0: 大家好,欢迎来到今天的会议。
    speaker0: 我们今天主要讨论三个问题。
    speaker1: 我先补充一下背景信息。

    连续同说话人的片段会自动合并,方便阅读。

    2. SRT 字幕文件(无说话人)

    标准 SRT 格式,可直接导入视频剪辑软件或播放器:

    复制

    1
    00:00:00,000 –> 00:00:05,000
    大家好,欢迎来到今天的会议。

    2
    00:00:05,000 –> 00:00:10,000
    我们今天主要讨论三个问题。

    3. 双语 SRT 文件

    启用翻译后的 SRT 文件,每行字幕显示原文和译文:

    复制

    1
    00:00:00,000 –> 00:00:05,000
    大家好,欢迎来到今天的会议。
    Hello everyone, welcome to today's meeting.

    4. 总结文件

    包含 AI 生成的结构化总结:

    复制

    ## 摘要
    本次会议讨论了项目进度、资源分配和下阶段计划。

    ## 核心结论
    1. 项目整体进度符合预期。
    2. 需要增加两名后端开发人员。

    ## 待办事项
    – [ ] 周三前提交预算表
    – [ ] 周五前完成接口联调


    注意事项

  • GPU 显存要求:Qwen3-ASR-1.7B对显存有一定要求,显存不足时可能触发 OOM,建议关闭其他程序或降低批处理大小。
  • 翻译/总结需要 API Key:如果未填写 API Key 却勾选了翻译或总结,软件会提示错误并停止处理。
  • 断网/离线环境:如果不使用API功能的话,软件可在离线环境运行。

  • 常见问题

    识别结果不准确怎么办?

    • 尽量选择清晰的音频源
    • 在嘈杂环境或多人重叠对话时,说话人分离可能不够精准
    • 可尝试指定 ASR 语言而非自动识别

    结语

    本软件整合了当前先进的语音识别、说话人分离与大语言模型能力,旨在帮助用户快速、便捷地完成音视频字幕制作、翻译与总结工作。

    区分说话人音视频语音识别软件下载链接:

    夸克网盘分享

    赞(0)
    未经允许不得转载:171主机测评 » 最强免费分说话人语音识别工具,支持批量音视频识别转字幕,字幕翻译内容总结软件
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址