Buzz 本地离线音频转录速成教程:免费把每段录音变文字
Buzz 本地离线音频转录速成教程免费把每段录音变文字【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 的开源本地离线音频转录工具它能把你电脑里的录音和视频免费转成带时间戳的文字和字幕全程不上传、不联网。读完这篇你会从装好软件开始跑通第一次转录调对关键参数再到批量、实时、多人对话和自动化这几件进阶事全都能上手。复盘三个最难受的旧场景答辩前夜研究生小林还有一堆访谈录音没转写在线网站转了十几分钟就弹窗要付费稍微带点环境音就整段乱码而把受访者录音传到云端导师明确反对。剪辑师老周更惨平台要 SRT 字幕他只能一边拖时间轴一边手敲时间码一个半小时的视频敲到凌晨行宽还得反复改。批量处理的播客主也是同款痛每周几十条新音频每天雷打不动花一小时拖进网页、等转完、下载文本、再归档。这三个场景的共性就一条——旧方案要么贵要么慢要么不安全。看懂为什么选 Buzz硬指标在线转写服务Buzz数据去向上传到第三方服务器全程留在本机不出设备费用按时长计费或订阅开源免费代码公开断网状态直接不可用完全可用拔网线照跑系统覆盖大多只有网页版Windows / macOS / Linux 都有安装包三条卖点拆开说第一隐私是底色商业会议、访谈素材从头到尾碰不到别人第二开源社区迭代快今天提交的 bug 过几天可能就修好了第三硬件吃得起就快NVIDIA 显卡可以开 CUDA 加速Apple Silicon 有专门优化纯 CPU 也能跑只是快慢差别。三分钟跑通首次转录第1步装好软件Windows 双击安装包按向导走完即可macOS 下载 dmg 拖进应用程序Linux 可以走 Flatpak 或 Snap。装完打开看到主界面任务列表空白但按钮亮着界面能正常弹出就算安装成功。详细步骤可看官方文档。第2步喂进文件点工具栏的按钮、按CtrlO、或者直接把文件拖进窗口MP3、WAV、FLAC、MP4、AVI 这些主流格式都认识。更省事的是直接贴 YouTube 链接它会自动拉取音频进队列。看到任务出现在列表里、状态显示Queued排队中说明文件喂进去了。第3步选参数点运行在任务行里选任务类型、语言、模型和输出格式然后点运行。任务进入队列后主界面会实时刷状态多文件会自动排队并发处理。看到进度条在走、状态变成 In Progress就算整条链路配置成功了。第4步拿走结果处理完点任务行右侧打开转录窗口逐句文本、起止时间一目了然可以直接复制也可以导出成文件。在导出文件夹里看到对应的 txt/srt 文件这一单就算彻底跑通了。调对四个决定成色的参数任务类型转录还是翻译任务类型只有两档转录按原语言出文本翻译会把非英语音频直接输出成英文。目标是同语言文字稿就选转录必须交英文稿就选翻译。把中文录音选成翻译出来的是英文想拿回原语言只能再跑一遍。语言能手动就别猜语言可以留空让它自动检测也可以直接指定内置 99 种以上语言。事先知道录音是什么语言就直接填比如中文填 zh。留空猜错在短音频或语言混杂时最容易出现整段文本会顺着错判跑偏。模型大小速度精度二选一模型大小从 tiny 到 large 分五档是速度和准确率的跷跷板。日常听写选 small 或 medium重要材料上 large实时场景用 tiny。低端机器硬跑 large 会慢到怀疑人生反过来 tiny 遇到浓重口音和专业词汇也容易认错一大片。输出格式一次勾全省得重来输出格式支持 txt、srt、vtt可以多选。要纯文字稿勾 txt要给视频配字幕勾 srt 或 vtt。忘了勾 srt 等转完才想起来要上字幕就只能重新导出白等一轮。初始提示词给模型递小抄初始提示词是一句你提前写好的话相当于告诉模型多留意这几个词。录音里的人名、地名、专有名词、行业术语都往里面填。不填的话这些词大概率出成同音字事后一个词一个词地改比当初多花十分钟填提示词痛苦得多。按你想干成的事选玩法长录音批量出文字稿一次性导入十几个文件模型和语言设好后让它们排队跑结果统一落到导出文件夹。想彻底省掉界面可以用命令行挂着批量做一行一个任务buzz add --task transcribe --language zh meeting.mp3 buzz add --task translate --model-type whispercpp *.mp3 buzz add --srt --vtt --txt video.mp4更多参数见命令行文档。适合研究者、播客主这类素材量大的人。字幕要上平台打开转录窗口点Resize填一个目标字幕长度下面三个合并开关各管一件事——按时间间隔合并过碎的条目、按标点把长句拆开、按最大长度强制分块。改几个数字就能适配不同平台的字幕规范。适合视频创作者把字幕环节从手工活变成几分钟的自动活。现场边说边出字点工具栏的麦克风按钮开始实时转录说话的同时屏幕蹦字还能切到演示窗口放大投屏。在线会议出纪要、课堂记笔记、访谈边聊边出稿都是它的主场。适合需要当下就要文字的人。多人对话分清谁说的在转录结果里启用说话人识别Buzz 会自动给不同发言者打标每句都带着谁说的。会议纪要、访谈整理不用再对着通篇他说她说猜。适合访谈者、会议组织者。丢进文件夹就不用管在偏好设置的Folder Watch里指定一个监控文件夹之后的新音频放进去就自动转录全程不用人守着。再搭配内置的**跳过已转录**插件重复文件直接略过。Buzz 的插件体系还有 AI 摘要、导出 DOCX、字幕优化等见插件目录按需开关。适合固定工作流、定期有新素材的人。按角色对号入座学生课程录音 → 小模型批量转写靠时间戳复习时直接跳到对应知识点视频创作者成片视频 → 导出 SRT/VTT 后用 Resize 统一行宽直接进剪辑软件职场人会议录音 → 实时转录 说话人识别出纪要数据不出本机研究者访谈素材 → 大模型精跑 说话人标签导出文本直奔内容分析避开五个常见坑 ⚡先用小模型摸底再用大模型精跑。批量任务先用 small 把全部文件快跑一遍确认内容无误只把真正重要的几段换 large 重跑最省重复等待。先指定语言再谈模型。手动指定语言对准确率的提升往往比把模型升一档还明显这一步成本是零。先清音频再转录。环境吵的录音先勾上提取语音或用 DeepFilterNet 插件降噪干净输入省下的纠错时间远超处理本身。先写提示词再开跑。讲座、专业讨论里把术语写进初始提示词专有名词识别立刻上一个台阶别等结果出来再补救。先下好模型再启动批量。批量跑之前在模型设置里确认目标模型已下载中途才触发下载会把整个队列卡住。答五个问得最多的问题Q必须联网吗A不用。所有处理都在本机完成只有你主动选 OpenAI 在线 API 时才需要网络。Q支持哪些格式A常见音视频基本全支持MP3、WAV、FLAC、MP4、AVI 等另外可以直接导入 YouTube 链接。Q一个文件能多长A没有硬性上限几秒的语音和几小时的长录音都能处理时间只和模型、硬件有关。QWindows 安装时弹窗警告正常吗A正常。程序未签名点更多信息 → 仍要运行即可继续安装。Q结果文件存在哪A在偏好设置里配置的导出文件夹默认命名和保存位置都可以自定义。现在就动手从把录音拖进窗口的那一刻起Buzz 就把听写从外包服务变成了你自己电脑上的免费能力。去下载对应系统的安装包把第一段录音喂进去。让第一行字幕出自你自己的电脑。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考