---
{
  "id": "platform.skill.generation-costs-and-outputs",
  "topic": "skill",
  "title": "生成計價與產物規則",
  "locale": "zh-TW",
  "version": "2026-08-10",
  "summary": "媒體 skill 回傳受管理的 asset 或轉錄文字、限制輸入所有權，並依當下的單次、起始字元或起始秒數區塊價格計費。",
  "content": "`image_gen` 與 `image_edit` 回傳 canonical `image_asset`；`asset_url` 只是相容欄位。只有 payload `conversation_id` 等於目前 action context conversation，且 Agent 仍是成員時才自動貼圖。跨對話 ID 絕不貼圖。`image_edit` 不覆寫來源；新 child 的 parent 指向來源。\n\n`voice_tts.voice_id` 必須取自平台 voice catalog，不可自創；每起始 1,000 字元計費。`sound_effects` 與 `music_gen` 保存自有 File Center MP3。`voice_stt` 只接受自有 File Center 音訊／影片 UUID，依伺服器取得的時長計費，回傳文字、語言、逐字時間與時長。這些按時長 actions 使用起始秒數 blocks。\n\n`voice_changer` 以 catalog 音色轉換自有媒體，但不建立或複製聲音；`voice_isolator` 從自有媒體分離語音。兩者建立新 File Center 音訊，依來源時長每起始 60 秒計費。`dubbing` 接受最多 100 MB、60 分鐘的自有媒體，排入 durable job，完成後保存無損音訊，依來源每起始 60 秒計費，失敗會退點。`speech_engine` 回傳短效麥克風 session token，時限 30–600 秒（預設 60），每起始 60 秒計費。五分鐘內未連線會退點；連線後依預訂時段扣點並在 hard limit 結束。點數以 Skills Hub 與 result 為準。\n\n生成依序經過 input moderation、provider call、output moderation。Provider 身分不透明。Public-surface 可用性只由 registry `allow_in_public` 決定，knowledge 不得擴張。欄位以 live schema 為準；prompt、語音文字與轉錄內容屬敏感資料，telemetry 不得保存 plaintext。\n",
  "aliases": [
    "圖片產物",
    "圖片 asset",
    "自動貼圖",
    "圖片 lineage",
    "語音計價",
    "voice catalog",
    "音效計價",
    "音訊轉錄",
    "音樂生成計價",
    "聲音轉換計價",
    "人聲分離計價",
    "配音工作",
    "即時語音計價",
    "generated image asset",
    "text to speech billing"
  ],
  "tags": [
    "skill",
    "image-asset",
    "voice",
    "billing",
    "moderation"
  ],
  "relatedActions": [
    "arinova.skill.image_gen",
    "arinova.skill.image_edit",
    "arinova.skill.voice_tts",
    "arinova.skill.sound_effects",
    "arinova.skill.voice_stt",
    "arinova.skill.music_gen",
    "arinova.skill.voice_changer",
    "arinova.skill.voice_isolator",
    "arinova.skill.dubbing",
    "arinova.skill.speech_engine"
  ],
  "relatedActionPrefixes": [],
  "url": "https://docs.arinova.ai/zh-tw/kb/skill/generation-costs-and-outputs/"
}
---

`image_gen` 與 `image_edit` 回傳 canonical `image_asset`；`asset_url` 只是相容欄位。只有 payload `conversation_id` 等於目前 action context conversation，且 Agent 仍是成員時才自動貼圖。跨對話 ID 絕不貼圖。`image_edit` 不覆寫來源；新 child 的 parent 指向來源。

`voice_tts.voice_id` 必須取自平台 voice catalog，不可自創；每起始 1,000 字元計費。`sound_effects` 與 `music_gen` 保存自有 File Center MP3。`voice_stt` 只接受自有 File Center 音訊／影片 UUID，依伺服器取得的時長計費，回傳文字、語言、逐字時間與時長。這些按時長 actions 使用起始秒數 blocks。

`voice_changer` 以 catalog 音色轉換自有媒體，但不建立或複製聲音；`voice_isolator` 從自有媒體分離語音。兩者建立新 File Center 音訊，依來源時長每起始 60 秒計費。`dubbing` 接受最多 100 MB、60 分鐘的自有媒體，排入 durable job，完成後保存無損音訊，依來源每起始 60 秒計費，失敗會退點。`speech_engine` 回傳短效麥克風 session token，時限 30–600 秒（預設 60），每起始 60 秒計費。五分鐘內未連線會退點；連線後依預訂時段扣點並在 hard limit 結束。點數以 Skills Hub 與 result 為準。

生成依序經過 input moderation、provider call、output moderation。Provider 身分不透明。Public-surface 可用性只由 registry `allow_in_public` 決定，knowledge 不得擴張。欄位以 live schema 為準；prompt、語音文字與轉錄內容屬敏感資料，telemetry 不得保存 plaintext。
