一个简单的本地语音识别服务

2024-01-01 23:26:55 +08:00
 jianchang512
基于 openai-whipser 开源模型和 flask ,搭建的本地离线运行的语音识别服务,主要自用用于取代百度语音识别的。

GitHub: https://github.com/jianchang512/stt

这是一个离线运行的本地语音识别转文字工具,基于 openai-whipser 开源模型,可将视频/音频中的人类声音识别并转为文字,可输出 json 格式、srt 字幕带时间戳格式、纯文字格式。可用于自行部署后替代 openai 的语音识别接口或百度语音识别等,准确率基本等同 openai 官方 api 接口。


<amp-youtube data-videoid="QOEYNQQbxF8" layout="responsive" width="480" height="270"></amp-youtube>
3057 次点击
所在节点    分享创造
10 条回复
lloovve
2024-01-02 00:56:11 +08:00
识别效果如何?能在 linux 下部署么
kkstart
2024-01-02 01:18:55 +08:00
赞,效果如何?
tqyq88
2024-01-02 08:57:40 +08:00
https://github.com/SYSTRAN/faster-whisper 这个性能吊打 openai 原生的
eatgrass
2024-01-02 11:29:27 +08:00
https://huggingface.co/spaces/Xenova/whisper-web
直接浏览器里运行,0 部署
JNian
2024-01-02 15:06:59 +08:00
请问作者有没有考虑增加 diarization 功能
buyno1
306 天前
对 windows 版本有什么要求?电脑配图有什么要求
buyno1
305 天前
@tqyq88 colab 有没有平替的 用来你说这个部署
buyno1
305 天前
@eatgrass 用 19 秒的 mp3 试了 报错
chopin1998519
160 天前
WizardLeo
56 天前
@eatgrass 有点强,这个真好用

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://tanronggui.xyz/t/1005010

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX