Whisper 本机识别
不上传、不花钱的语音识别
基于 whisper.cpp,在 Apple Silicon 上用 Metal 加速。插件和模型分开:模型自己挑、自己决定放哪块盘,推荐 large-v3-turbo 量化版,574 MB。
视频 → 字幕 → 讲义
拓义把课程视频抽出音频、识别成带时间轴的字幕,再交给 AI 写成带关键帧截图的 Markdown 讲义。讲义 PDF、课本、资料和进度,都按课程文件夹放在你自己的磁盘上。
密钥自备:阿里云百炼、火山引擎豆包,或本机 Whisper。没有账号、没有遥测。
同一面灰墙,在蓝沙发旁偏暖,在橙沙发旁偏冷。样色要刷在真实的墙上、真实的光线下,住几天再定。
怎么用
拓义不改你的文件。视频留在原处,每一步的产物都写回同一个课程文件夹,随时能用别的软件打开。
ffmpeg 从视频里抽出单声道音频,只留下识别需要的部分。
句级时间戳,跟着播放滚动,点一句就跳到那一秒。有同名字幕文件就直接导入,不再识别。
按课程自己的提示词,把口语整理成有层级、保留例子和原话的 Markdown。
板书、幻灯片切换的画面自动截下来插进讲义;看视频时也能随手截图配进笔记。
功能
登记一个「资产库」文件夹,里面的课程按层级自动出现,上级文件夹名就是分类。每门课用同一套预设子目录,也可以自己改名。
视频/ 讲义/ 课本/ 资料/ 字幕/ 笔记/,加一个放派生数据的 .tayi/。老课程一条命令整理成这个样子,只复制不删除。
把文件夹放进资产库就成了课程;库外的文件夹可以一键导入并整理。多个资产库、多块硬盘都行。
逐句编辑随时保存;英文课程一键逐行翻成中文,原文下方对照显示。
Markdown 讲义在课程文件夹里,所见即所得地改;截图直接插进当前段落,图片存在旁边的目录。
讲义 PDF 可以挑页插进笔记;课本、资料在讲次页右栏直接预览,也能全屏读。PDF 还能整本翻译。
看到哪一秒记在课程文件夹里,换台电脑接着看。首页按书架、目录、看板、封面墙四种方式浏览。
界面



识别与隐私
拓义不经手你的账号。云端识别用你自己的 API Key,按各家的价格直接结算;不想上传就用本机 Whisper。
| 服务 | 特点 | 音频怎么传 |
|---|---|---|
| 阿里云百炼 | Qwen-Audio 文件转写,中文准,有免费额度 | 直传百炼临时存储,不需要对象存储 |
| 火山引擎 豆包 | 标准版 / 极速版 / 闲时版,中文与中英混合最稳 | 极速版随请求直传;标准版、闲时版经你自己的对象存储中转 |
| 本机 Whisper插件 | 多语种,俄语、韩语、日语都好;不花钱、不上传 | 不传,全在本机 |
| 兼容接口 | 任何 OpenAI 式转写接口:另一台机器、远程服务 | 直接发给那台机器 |
应用不向任何人报告你在学什么。设置、密钥、进度都在本机的配置目录里。
字幕是 JSON 和 SRT,讲义是 Markdown,截图是 PNG。不用拓义了也一样能读。
只有火山的标准版和闲时版要经它中转。腾讯云 COS、阿里云 OSS、AWS S3、MinIO 都行,设置页里能一键测试。
插件
插件是独立的服务,拓义通过本机端口调它。它们可以装在这台电脑上,也可以跑在别的机器上,多台设备共用。
Whisper 本机识别
基于 whisper.cpp,在 Apple Silicon 上用 Metal 加速。插件和模型分开:模型自己挑、自己决定放哪块盘,推荐 large-v3-turbo 量化版,574 MB。
PDF 翻译
基于开源的 BabelDOC,输出单语版和双语对照版,写在原 PDF 旁边。翻译用你在讲义里填的同一个 AI 接口。服务本身开源(AGPL),可以放在 NAS 的容器里给全家用。
两种用法
一个 .app,打开就是。视频可以在本地硬盘,也可以在挂载的网络盘上。
同一套服务端跑在容器里,浏览器里用;手机、平板也能看视频读讲义。
下载
macOS 13+Apple SiliconDMG · 152 MB2026-09-15
预览版还没有签名。第一次打开会提示「无法验证开发者」:右键点应用 → 打开 → 再点一次打开;或者在终端执行 xattr -dr com.apple.quarantine /Applications/拓义.app。识别和讲义需要你自己的 API Key,或者装本机 Whisper 插件。