之前推荐过讯飞语言转写,可领取录音文件转写免费5小时额度,无奈有时间限制,且额度比较低。为不受限制,我们可搞个本地识别。得益于众多免费开源AI大模型,简单配置即可轻松实现想要的功能,下面介绍两个版本,给大家提供思路。

一、CPU版

论坛:https://www.52pojie.cn/thread-1954443-1-1.html

下载软件和模型,设置加载模型位置

选择转写文件、识别模型,开始识别

缺点:速度取决于CPU性能,长录音可能很慢,显卡版则可以大幅提高识别速率

二、显卡版

1、安装CUDA

准备工作:英伟达显卡安装CUDA,检查是否安装CUDA:Win+R,cmd,回车

 nvcc --version

提示:nvcc不是内部或外部命令 ,则需自行安装,建议NVIDIA App驱动程序,更新到最新版。然后通过NVIDIA App-系统-我的装备打开NVIDIA控制面板,选择帮助-系统信息-组件,查看CUDA版本。

下载CUDA Toolkit:https://developer.nvidia.com/cuda-toolkit-archive

一路默认安装,检查CUDA是否安装成功

 nvcc --version

2、下载语言模型

模型下载网站:https://huggingface.co/

搜索模型:ggerganov/whisper.cpp,切换到Files and versions选项卡,选择适合自己的模型下载

可选中等模型ggml-medium.bin,若下载慢/无法下载,可右键复制链接到迅雷下载

3、下载Whisper

下载WhisperDesktop.zip到本地

加载bin语言模型

切换到转换语音文件模式

选择转换语言,音频位置,保存文件格式及位置,然后点击Transcribe,进行语音识别 

可选SubRip subtitles字幕文件,这里选文本

NVIDIA GeForce RTX 3060

专用 GPU 内存 12.0 GB

共享 GPU 内存 8.0 GB

中等模型效率:大概1分钟转换9.0分钟的音频

大型模型效率:大概1分钟转换5.5分钟的音频

对比转写结果,发现大型模型的识别准确度更高,而显存也仅占用5G多

上述软件及模型,已经转录网盘,方便下载







文件名称:Whisper及模型
适用版本:Windows
更新日期:2025-07-25
文件大小:1.8G


Invitation
QQ Group
1095632335

created:04/01/2020

Welcome to the Group

Use this card to join us and participate in a pleasant discussion together .

Welcome to JISHUSONGSHU Group,wish you a nice day .