跳到主要內容

地端模型解決方案

虛擬人、AI 影片、配音與音樂,在你自己的 GPU 上生成

把開源模型架在你的 GPU 主機上:替虛擬人訓練專屬 LoRA,換場景、換衣服都是同一張臉,讓他們拍日常短片、演短劇並用自己的聲音對嘴;從一個主題、一篇新聞或一份簡報做出有配音字幕的影片;也能訓練專屬聲音、生成配樂、把錄音轉成逐字稿。圖片、影片與聲音都在你的機器上生成,也沒有按次計費。

生成成果

用這個平台實際生成的短片:第一支是 AI 廣告;接著三支是虛擬人開口說話,台詞用角色的聲音、對嘴、燒上字幕;最後三支是以虛擬人的一張關鍵影格當首幀做圖生影片(MiniMax H3),每支 5 秒,沒有剪輯。

  • AI 廣告:帶三歲小孩去關西的親子旅遊廣告,58 秒、11 段畫面,每段有標題和字幕,最後一幕收在「立即索取行程表」。
  • 打招呼:在唱片行對著鏡頭自我介紹、請大家追蹤,一句 8 秒的台詞,字幕跟著聲音走。
  • 對嘴特寫:戴眼鏡的男生對鏡頭說話,臉拍得這麼近,嘴型和聲音一樣對得上。
  • 週末 vlog:在公園邊走邊聊三個放慢腳步的小方法,37 秒換了好幾個鏡頭,臉和聲音從頭到尾是同一個人。
  • 公園步道:她邊笑邊走向鏡頭,臉、衣服與光線都跟首幀那張關鍵影格一致。
  • 整理行李:手扶行李箱,低頭笑了一下再抬頭看鏡頭;房間與晨光從頭到尾沒有走樣。
  • 咖啡店:端起咖啡喝一口,鏡頭慢慢推近到她對鏡頭微笑;配樂與環境音也是模型一起生成的。

適合

  • 要大量產出圖片、語音或影片,按次計費的雲端服務算下來太貴
  • 錄音、影像或逐字稿屬於敏感資料,不能送到第三方
  • 需要固定的品牌聲音或代言人形象,每次輸出都要一致

不適合

  • 一個月只做幾支,用現成雲端服務更划算
  • 沒有被授權的聲音或肖像素材

我們會交付

  1. 01虛擬人:用授權的素材訓練專屬角色 LoRA,換場景、換衣服都是同一張臉,聲音與人設一起設定好
  2. 02虛擬人影片:直式日常短片,或 2~4 位同框的生活短劇;台詞用各自的聲音對嘴,劇本、分鏡、畫面每一步都能停下來改
  3. 03AI 製片:從主題、新聞、Blog 或 PDF/簡報開始,AI 寫腳本、挑畫面、配音上字幕,再用時間軸剪成片
  4. 04生成工坊:文生圖、圖生圖、修圖、換裝、圖生影片、配樂與語音,模型可以切換,成品自動存進媒體庫
  5. 05聲音與剪輯:用錄音訓練專屬音色;會議、客服錄音轉逐字稿,含時間軸與講者分離;Podcast 與影片剪掉空白與重複,輸出短版與字幕
  6. 06部署與介面:跑在你的 GPU 主機,或我們替你代購的雲端 GPU;附 GPU 佇列與顯存監看、API 與 MCP 工具;寫腳本可以接 Claude,也可以全用本機模型

實際畫面

「虛擬人與 AI 影像生成平台」的實際畫面,點圖片可以看原尺寸。

  • 虛擬人:每位角色都有專屬 LoRA、人設與社群帳號,素材完整度一眼看得到。
    虛擬人:每位角色都有專屬 LoRA、人設與社群帳號,素材完整度一眼看得到。
  • 虛擬人日常影片:選一位虛擬人、講一句今天想拍什麼,剪成像隨手拍的直式短片。
    虛擬人日常影片:選一位虛擬人、講一句今天想拍什麼,剪成像隨手拍的直式短片。
  • 虛擬人短劇:選 2~4 位演員、講一句點子,劇本、分鏡、圖片、影片逐步確認。
    虛擬人短劇:選 2~4 位演員、講一句點子,劇本、分鏡、圖片、影片逐步確認。
  • 生成工坊:圖、影片、音樂、聲音分頁,生圖模型可以切換,成品自動存進媒體庫。
    生成工坊:圖、影片、音樂、聲音分頁,生圖模型可以切換,成品自動存進媒體庫。
  • AI 製片:從主題、新聞或 Blog 開始,多個 AI 代理寫腳本,最後配音、上字幕成片。
    AI 製片:從主題、新聞或 Blog 開始,多個 AI 代理寫腳本,最後配音、上字幕成片。
  • 放鬆專輯:四個 AI 分工排出從緊繃到放鬆的曲序,再用 ACE-Step 逐首生成。
    放鬆專輯:四個 AI 分工排出從緊繃到放鬆的曲序,再用 ACE-Step 逐首生成。
看「虛擬人與 AI 影像生成平台」的介紹

相關文章

負責人部落格上的實作文章,記錄做法與遇到的問題。

相關作品

我們自己在營運或公開發佈、跟這項服務同類型的東西。

  • 聲音訓練與微調

    地端模型

    聲音訓練與微調

    用你提供的錄音,在本機 GPU 上微調出專屬的聲音。訓練好的聲音可以直接拿文字合成語音,並調整穩定度、語速與情緒;台灣腔的讀音另有修正表可以校正。

    • 每個聲音各自訓練一份 adapter,每一輪都留版本,用同一段文字逐版試聽後再挑定
    • 錄音還不夠時先用零樣本克隆,3–15 秒乾淨人聲就能出第一版試聽

    Qwen3-TTS · CosyVoice3 · LoRA · 本機 GPU · MCP

    看內頁地端模型解決方案前往網站
  • Seal-TTS 台灣腔語音平台

    Seal-TTS 台灣腔語音平台

    架在本機 GPU 的語音平台:用錄音訓練專屬聲音、零樣本即時克隆、多人對話 podcast、語音辨識、人聲分離與發音修正。AgentHub 的 LINE 語音推播使用它合成。

    • Qwen3-TTS
    • CosyVoice3
    • 本機 GPU
    • MCP
  • AI Podcast Cut

    剪掉 podcast 的贅字與口吃:用本機的 faster-whisper 辨識、demucs 人聲分離,平衡音量並保留呼吸,輸出前可以逐個接縫試聽。全部在本機執行。

    • faster-whisper
    • demucs
    • Rust
    • ffmpeg
    • 開源
  • AI Video Cut

    在影片裡選一個東西(打字、點選,或交給 AI 挑),逐幀追蹤後幫它打碼、換成你的圖片或影片,或用其他幀拍到的背景把它移除。另有序列剪輯與本機字幕,全部在自己的 GPU 上跑,影片不上傳。

    • SAM 2.1
    • faster-whisper
    • MCP
    • 本機 GPU
    • MIT
看全部作品

常見問題

依模型與品質要求而定,通常幾分鐘乾淨的錄音就能出第一版,要更穩定則需要半小時到一小時。我們會先用你手上現有的素材做一版試聽,你聽得可以再往下做。