之前推荐过讯飞语言转写,可领取录音文件转写免费5小时额度,无奈有时间限制,且额度比较低。为不受限制,我们可搞个本地识别。得益于众多免费开源AI大模型,简单配置即可轻松实现想要的功能,下面介绍两个版本,给大家提供思路。
一、CPU版
论坛:https://www.52pojie.cn/thread-1954443-1-1.html
下载软件和模型,设置加载模型位置

选择转写文件、识别模型,开始识别

缺点:速度取决于CPU性能,长录音可能很慢,显卡版则可以大幅提高识别速率
二、显卡版
1、安装CUDA
准备工作:英伟达显卡安装CUDA,检查是否安装CUDA:Win+R,cmd,回车
nvcc --version
提示:nvcc不是内部或外部命令 ,则需自行安装,建议NVIDIA App–驱动程序,更新到最新版。然后通过NVIDIA App-系统-我的装备打开NVIDIA控制面板,选择帮助-系统信息-组件,查看CUDA版本。

下载CUDA Toolkit:https://developer.nvidia.com/cuda-toolkit-archive

一路默认安装,检查CUDA是否安装成功
nvcc --version

2、下载语言模型
模型下载网站:https://huggingface.co/
搜索模型:ggerganov/whisper.cpp,切换到Files and versions选项卡,选择适合自己的模型下载

可选中等模型ggml-medium.bin,若下载慢/无法下载,可右键复制链接到迅雷下载
3、下载Whisper
下载WhisperDesktop.zip到本地
加载bin语言模型

切换到转换语音文件模式

选择转换语言,音频位置,保存文件格式及位置,然后点击Transcribe,进行语音识别

可选SubRip subtitles字幕文件,这里选文本
NVIDIA GeForce RTX 3060
专用 GPU 内存 12.0 GB
共享 GPU 内存 8.0 GB
中等模型效率:大概1分钟转换9.0分钟的音频
大型模型效率:大概1分钟转换5.5分钟的音频
对比转写结果,发现大型模型的识别准确度更高,而显存也仅占用5G多
上述软件及模型,已经转录网盘,方便下载
附
件
下
载
文件名称:Whisper及模型
适用版本:Windows
更新日期:2025-07-25
文件大小:1.8G
提示:遇问题或链接失效请联系站长,本站欢迎捐赠!

Use this card to join us and participate in a pleasant discussion together .
Welcome to JISHUSONGSHU Group,wish you a nice day .






