LinguaScribe 是一套「本機優先、線上能力可選」的多語語音內容工作站。核心工作流程不是只有語音轉文字,而是將一段演講、會議、訪談或課程,依序完成:
- 轉文字與人工校對
- 彙整摘要
- XMind 心智圖
- Mermaid 思考流程圖
- 辭典、語言版本與安全設定
Windows 可由根目錄的 LinguaScribeOffline.exe 啟動。GitHub Pages 使用 docs/ 發布同一套五頁介面;靜態網站的人工校對、繪圖、版本切換及匯出在瀏覽器執行,自動辨識、摘要與翻譯可連至使用者自行部署的安全後端。
- 上傳音訊或影片:桌面模型或自選安全後端可自動辨識;未設定時直接開啟邊聽邊人工轉錄工作台,不再阻擋其他模組。
- 支援現場麥克風即時暫定稿。
- 匯入 JSON、TXT、SRT、VTT 繼續校對。
- 說話者 A、B 等可整批改名,也可逐段修改。
- 邊聽邊改、修改起迄時間、全文編輯與逐段編輯。
- 儲存時選擇 TXT、Markdown、JSON、SRT、VTT、是否保留時間戳及輸出語言。
- 一般摘要、會議紀錄、訪談分析、研究資料及課程講授模式。
- 產出核心摘要、重點、決策、待辦事項、風險與待釐清問題。
- 摘要可直接人工修改,下載 JSON 或 Markdown。
- 從逐字稿及摘要建立 TAB 階層內容。
- 網頁直接顯示 SVG 心智圖。
- 下載
.xmind、SVG、TAB 純文字及 OPML。 - TAB 內容修改後可立即重新繪製。
- 分析演講脈絡、因果關係、條件、回饋與決策邏輯。
- 節點支援開始、處理、判斷、結束。
- Mermaid 是流程圖的標準文字來源;內建 Mermaid 11.12.2 瀏覽器執行元件,並在載入失敗時切換相容 SVG 繪圖器。
- 下載 SVG、可獨立開啟的 HTML、
.mmdMermaid 原始碼與 JSON。
- 桌面版內建約 45.7 萬筆中、英、日、德、法離線辭典索引。
- 支援自訂人名、機構名、專業詞彙及常見誤辨詞。
- 辭典更新只有在使用者主動按下時才連線,更新前備份並驗證;失敗時保留或回復上一版。
- 安全後端網址與工作階段權杖可在介面設定,API 金鑰不得放入 GitHub Pages。
每個模組右上角都可建立並切換:
- 原始版本
- 繁體中文
- 中文(簡體)
- 英語
- 日語
- 德語
- 法語
翻譯會建立另一個語言版本,不直接覆寫原始版本;可隨時切回,也可將目前語言另存。
- 完整解壓縮 ZIP。
- 點兩下
LinguaScribeOffline.exe。 - 若完整桌面 Python 環境存在,啟動 FastAPI 本機應用程式;否則啟動內嵌的五頁瀏覽器工作站。
在 Repository 的 Settings → Pages 設定:
- Source:Deploy from a branch
- Branch:main
- Folder:/docs
網站網址通常為:https://cat-cookies.github.io/LinguaScribeOffline/
online-backend/cloudflare-worker/ 可部署 Cloudflare Worker,提供:
/transcribe/summarize/mindmap/flowchart/translate/translate-transcript
請依 CLOUDFLARE_WORKER_部署教學.txt 設定 OPENAI_API_KEY 與 APP_ACCESS_TOKEN。第三方模型服務可能產生費用,並會接收使用者主動提交的內容。
- GitHub Pages 本身是公開網站,但使用者選取的檔案不會被上傳到 GitHub。
- 人工校對、瀏覽器繪圖、XMind/SVG/HTML/Mermaid 匯出都可在前端完成。
- 使用安全線上後端時,只有在使用者確認後,內容才會送往其自行設定的後端與模型供應商。
- 網站版不內嵌大型 WASM 語音模型;自動辨識依瀏覽器語音服務或安全後端。
.exe是 Windows 執行檔;macOS 與 Linux 使用各自的啟動檔或建置產物。
專案程式碼採 MIT License。第三方辭典、Mermaid、JSZip、XMind 格式與可選服務之授權及來源,請見 THIRD_PARTY_NOTICES.md 與 app/data/dictionaries/README-LICENSES.md。
- 移除摘要、XMind 心智圖、Mermaid 流程圖與基本翻譯對安全後端的硬性依賴。
- GitHub Pages 無後端時,自動使用瀏覽器端抽取式摘要、規則式心智圖與規則式流程圖。
- 加入 CC-CEDICT 繁簡轉換資源,以及五語跨語專業詞庫草稿。
- 支援 Chrome Translator API;不可用時保留原文並替換可辨識的專業術語,明確提示人工校對。
- 後端失敗時自動降級,不再讓整個按鈕功能中止。
- 未設定完整檔案辨識後端時,會開啟邊聽邊人工轉錄工作台;現場麥克風仍可用瀏覽器語音辨識。