因為想要生成合成的人聲, 所以需要一組 Gemini API Key, 取得Key 的操作步驟如下:
一、 前往 Google AI Studio 網站,並使用一般的 Google 帳號登入。
二、 在頁面左上角或選單中找到 Get API key 按鈕並點擊。

三、 點選 Create API key ,選擇現有的 Google Cloud 專案或讓系統自動建立一個新專案。

四、 系統生成密鑰後,複製並妥善保存該字串。

取得金鑰後即可在程式碼中調用 gemini-3.8-flash-tts 模型生成語音檔。免費層級額度有每分鐘請求數(RPM)與每日上限限制,且輸入資料可能用於改善服務,若作為個人開發或測試已相當足夠。
這份額度清單顯示了更嚴苛的限制,針對 Gemini 3.8 Flash TTS 模型的具體上限與計算方式如下:
模型主要額度限制:
- 一、 RPM(每分鐘請求數):3 次。
- 二、 TPM(每分鐘 Token 數):10,000 個 Token。
- 三、 RPD(每日請求數):10 次。
實際轉換成語音朗讀時,這些限制代表以下意義:
單次與每分鐘限制(TPM 10K):
生成語音的輸出 Token 換算比例約為每秒 25 個 Token。10,000 Token 的每分鐘上限,代表一分鐘內最多只能生成約 400 秒(約 6.6 分鐘)的語音檔。傳入的文字量必須控制在這個範圍內,否則會觸發 TPM 溢位。
每日總量限制(RPD 10 次):
一天最多只能發送 10 次請求。每次請求就算用到極致的 6.6 分鐘語音長度,一天能產出的總語音長度上限也只有約 66 分鐘(約 1 小時 6 分鐘)。
要透過這個免費額度唸完一本書,除了需要將文章拆成 10 個片段外,一天最多只能處理其中的 10 個段落。如果整本書的朗讀時間超過 1 小時,就必須分開好幾天才能全部轉換完畢。