全部Web服務

Okou上的語音與配音

把寫好的文字變成音訊檔案,音色你選,語氣你說了算。不用自己的文字轉語音帳號。

生成 · 無需配置 · 每次成功呼叫按託管積分計費

把文字給它,它給你音訊。選一個音色,再說說這句話該怎麼落地:從容不迫,還是乾脆明亮,用你跟人說話時的那種大白話就行。

音訊回來時是一個檔案,智能體可以馬上用:放進影片裡、附在訊息上,或者發布到頁面上。帳號由Okou持有,按你實際拿到的音訊量計費,所以你名下不會多出一個語音平臺的套餐。

語音與配音是什麼

多數團隊需要一條語音軌的時候,離需要一套語音策略還早得很。演示要旁白,報告在通勤路上聽更合適,影片得先有人念一遍才好剪。

這就是把那一步變成一次呼叫。文字進去,音訊檔案出來,用你選的音色;預設的讀法不是你要的,就再加一句關於語氣的說明。

因為它按音訊時長而不是按請求次數計價,讀一段話的工作流就只花一段話的錢。這才讓旁白成了可以順手加進定時任務的事,而不是單獨立項。

人們平時說的文字轉語音API或者AI配音工具,指的就是這件事。區別在於帳號放在誰那兒,以及呼叫它的通常是一個正在收尾的智能體,而不是一個手動匯出檔案的人。

語音與配音能做什麼

智能體能用它做什麼,做完又會拿回什麼。

你給什麼要念的文字,支援的語言都可以
拿到什麼一個音訊檔案,附一個連結,智能體可以直接拿去用
音色一組有名字的音色供你挑
語氣一句大白話,說清語調和語速
常見用途影片旁白、書面內容的音訊版、語音提醒

覆蓋範圍與限制

把它做不到的事先說清楚,免得有人圍著能力範圍之外的東西去設計工作流。

只有現成音色,不做克隆

你從服務提供的音色裡挑。復刻某個具體的人的聲音是另一種產品,涉及另一套授權問題,應該在那個人同意的前提下,走服務商連接器,而不是放在這裡。

一次只念一段

每次呼叫是一個音色念一段文字。兩個人的對話是好幾次呼叫加一次剪輯,值得在寫稿之前先想清楚。

語氣是請求,不是控制項

一句關於語調的說明確實會改變念法,但它不是一條打好標記的時間軸。任何必須踩準節拍的地方,在剪輯裡修比用文字描述更省事。

你寫什麼它念什麼

數字、縮寫和人名,模型覺得該怎麼念就怎麼念。碰上要緊的地方,直接在文字裡寫全,比跟語氣說明較勁快得多。

語音與配音怎麼收費

Web服務按呼叫次數扣積分,不按token計費。也沒有另一份廠商帳單要對。

計費每次成功呼叫按託管積分計費
執行在OpenAI
命令zero generate voice

按回來的音訊時長扣積分,大致相當於一分鐘語音19積分。一句短旁白幾乎不花什麼錢,一小時音訊則是值得專門決定一下的事。底下沒有訂閱,也沒有起步門檻。

產品名稱和標識歸各自所有者所有,出現在這裡只是為了說明某項服務基於什麼執行,不代表任何背書或合作關係。

設定與接入

無需設定

不用連線任何東西。不需要文字轉語音的帳號、金鑰或套餐。如果你要的是某個特定的克隆音色或者一整套錄音棚級功能,Okou也提供跑在你自己帳號上的語音平臺連接器。

誰可以用

產出音訊檔案是一項權限,按智能體、按人逐個授予;它和其他生成檔案用的是同一項權限,所以一個能說話的智能體同樣能畫圖。

團隊都用語音與配音做什麼

給智能體剛做完的東西配旁白

一段影片、一次操作講解、一份週報。智能體寫稿並念出來,事情就算做完了,不用再等某個拿著話筒的人。

把書面內容變成音訊版

一份簡報、一份報告、一組更新說明。那些從不開啟文件的人會在路上聽完,而每讀一遍只花幾個積分。

語音提醒和播報

那些需要被聽見而不是被讀到的短句,用到的時候現生成,不必為每種情況提前錄一遍。

什麼時候不該用語音與配音

如果這個聲音必須是某個特定的人的,就別用它,那首先是授權問題,其次才是技術問題。要反覆重剪的長音訊也別用,每次重新生成整個檔案太浪費。還有,當一個人念得再差也勝過它的時候,別用它;通常只要重點在於「這話是某個人說的」,就屬於這種情況。

別處怎麼稱呼它

同一件事在市場上有好幾種叫法。如果你比較過其中某一類產品,這裡說明它對應到這邊的什麼能力。

文字轉語音API

文字進,音訊出,透過程式可以呼叫的介面完成。說的正是這件事,只是帳號和金鑰在我們這邊。

AI配音

影片或演示的旁白,由稿子生成而不是錄出來。團隊找上這項服務,多半就是為了它。

不用API金鑰的TTS

當模型不是問題、帳號才是問題時,人們就會這樣搜。這裡不用註冊,也沒有什麼要粘進環境變數裡。

文章轉音訊

把寫出來的東西變成能聽的。按音訊時長計價,所以花費隨你實際發布的量走。

聲音克隆

另一回事,這裡有意不提供。請在聲音主人同意的前提下,用跑在你自己帳號上的語音平臺連接器。

語音與配音橫向對比

語音與配音對比自己開一個文字轉語音帳號

思路一樣,配置少得多。沒有金鑰要保管,沒有套餐要挑,訪問靠的是權限而不是一個共享的金鑰。

語音與配音對比語音平臺連接器

連接器跑在你自己的帳號上,能用到那個平臺的全部能力,包括克隆音色和錄音棚級的控制。這裡是快車道,適合那種「有就行」的旁白。

語音與配音對比自己錄

只要重點是「這話是某個人說的」,人念出來仍然更好。但如果一句話因為數字變了每週都得重做一遍,錄音就是用錯了工具。

一句話總結

給智能體已經做好的東西配上聲音,這是最快的一條路。只用現成音色,按分鐘計價,什麼都不用註冊。

常見問題

我需要OpenAI帳號嗎?

不需要。呼叫由Okou發起,音訊按積分計費。工作流裡不會出現你的金鑰。

可以選音色嗎?

可以,從服務提供的音色裡挑,同時還能用大白話描述你想要的語氣。

能克隆我的聲音嗎?

不能。克隆音色是有意不放進這項服務的。請在當事人同意的前提下,用跑在你自己帳號上的語音平臺連接器。

要花多少錢?

按音訊時長扣積分,一分鐘語音大約19積分。短句幾乎不花什麼錢。

支援哪些語言?

模型能念好幾種語言。如果要求聽起來像母語者,最好先聽一段樣音,再決定要不要把工作流押在上面。

能用在播客或影片裡嗎?

可以。產出的就是普通音訊檔案,和別的音軌一樣放進剪輯裡就行。

能做兩個人對話嗎?

一次呼叫做不了。分別生成每一段再拼起來,這樣停頓也更好把握。

怎麼讓某個人名唸對?

在你傳送的文字裡按發音拼出來。這比在語氣說明裡描述讀法更快,也更穩。

怎麼讓智能體用語音與配音

你用日常語言說清楚要什麼,智能體自己判斷該用哪個服務,再去發起呼叫。

給片子配旁白

給這段演示影片寫一份二十秒的稿子,用從容不迫的聲音念出來。

把報告聽完

把本週的總結變成音訊,我路上聽,控制在四分鐘以內。

一句話,念好

用堅定、平實的聲音念這條警告資訊,把檔案給我。