跳到主要內容

地端模型

聲音訓練與微調

用你提供的錄音,在本機 GPU 上微調出專屬的聲音。訓練好的聲音可以直接拿文字合成語音,並調整穩定度、語速與情緒;台灣腔的讀音另有修正表可以校正。

這個系統做到什麼

  • 每個聲音各自訓練一份 adapter,每一輪都留版本,用同一段文字逐版試聽後再挑定
  • 錄音還不夠時先用零樣本克隆,3–15 秒乾淨人聲就能出第一版試聽
  • 台灣腔讀音修正表:整詞替換與多音字指定,存檔後立即生效
  • 提供 HTTP API 與 MCP 工具;AgentHub 的 LINE 語音推播就是用它合成

內頁截圖

實際線上畫面,含客戶資料的欄位已遮蔽。 點圖可看原尺寸。

  • 訓練聲音合成:選一個訓練好的聲音,輸入文字、加上停頓或情緒後合成。
    訓練聲音合成:選一個訓練好的聲音,輸入文字、加上停頓或情緒後合成。
  • ICL 即時克隆:上傳 3–15 秒參考音與逐字稿,不用訓練就能先聽音色。
    ICL 即時克隆:上傳 3–15 秒參考音與逐字稿,不用訓練就能先聽音色。
  • 發音修正:台灣用語的整詞替換表,存檔後套用到所有聲音。
    發音修正:台灣用語的整詞替換表,存檔後套用到所有聲音。

虛擬人開口說話

聲音用在虛擬人身上的樣子:台詞用角色設定好的聲音念出來,畫面跟著台詞對嘴,字幕一起燒上。

  • 打招呼:在唱片行對著鏡頭自我介紹、請大家追蹤,一句 8 秒的台詞,字幕跟著聲音走。
  • 對嘴特寫:戴眼鏡的男生對鏡頭說話,臉拍得這麼近,嘴型和聲音一樣對得上。
  • 週末 vlog:在公園邊走邊聊三個放慢腳步的小方法,37 秒換了好幾個鏡頭,臉和聲音從頭到尾是同一個人。

其他作品

同一類服務的案例排在前面。

  • 虛擬人與 AI 影像生成平台

    地端模型

    虛擬人與 AI 影像生成平台

    架在自家 GPU 主機上的生成平台:每位虛擬人有自己的 LoRA,換場景、換衣服都是同一張臉,能拍日常短片、演多人短劇,台詞用自己的聲音對嘴;也能把一個主題、一篇新聞或一份簡報做成有配音字幕的影片,或做一整張純音樂專輯。圖片、影片、聲音與音樂都在本機 GPU 上生成。

    • 虛擬人:每位角色一份 LoRA,換場景、換衣服都是同一張臉,各有聲音與人設
    • 短片與短劇:AI 依序寫劇本、排分鏡、生圖、拍影片,每一步都可以停下來看、改、重做

    ComfyUI · Z-Image · Krea 2 · Wan 2.2 · LTX · ACE-Step · 本機 GPU

    看內頁地端模型解決方案
  • eSIM 226 電商

    電商網站

    eSIM 226 電商

    面向旅客的 eSIM 電商:八種語系、多幣別顯示、綠界/藍新金流,訂單付款後自動向上游供應商配發 eSIM 並寄出安裝信。

    • 八語系、多幣別,日本客人看到日圓
    • 付款完成自動向兩家上游供應商配發、失敗自動切換

    Next.js · PostgreSQL · Keycloak · 綠界/藍新 · Kubernetes

  • eSIM 電商後台

    後台系統

    eSIM 電商後台

    同一套電商的營運後台:商品、售價、訂單、退款、供應商與金流一站管理,還會主動把「收了錢卻沒出貨」這種事挑出來給人看。

    • 今日訂單、營收、待付款、待出貨一眼看完
    • AI 售價建議與批次上下架

    Next.js · PostgreSQL · Keycloak · GA4 Data API

    看內頁電商網站