Nick Automates 把 OmniVoice 放在 ElevenLabs 對面:給它一段短音檔,就能模仿原聲的音色、節奏與情緒,再用同一個聲音產生語音或對話。短片口播說支援將近 500 種語言,說明欄則寫成 600 多種;目前官方文件採用後者。

官方 README 建議使用 3 至 10 秒參考音檔。除了 voice cloning,voice design 模式還能指定性別、年齡、音高、口音與耳語等特徵,也支援 [laughter] 這類非語言標記。專案提供 Python API、命令列工具與本機 Web UI;聲音可以留在自己的機器上,前提是使用者自己準備執行環境與運算資源。

真正需要拆開的是「免費開源」四個字。程式碼採 Apache 2.0,但官方提供的預訓練模型另受 CC-BY-NC 約束,商業使用不是同一件事。它可以免費下載、研究與非商業使用,卻不是毫無授權限制的 ElevenLabs 替代品;本機執行也只是把雲端費用換成自己的硬體與維護成本。

短片還說有內建 MCP server,可以連上 Claude Code 或其他 coding agents。目前核心 README 列出的是 Python API、CLI 與本機 Web UI,沒有列出短片所稱的內建 MCP server。官方社群清單雖有具 MCP automation 的外部工具,卻不是核心 OmniVoice 本身。至於「完美複製」與相對 ElevenLabs 的品質,這次沒有獨立實測足以替短片背書;先把它看成規格積極、授權與整合仍須逐項確認的開源模型,比直接視為完整替代品準確。