Skip to content

MiniMax T2A API

模型简介

Exchange Token 通过下面这条原生路径提供 MiniMax 文本转语音能力:

  • POST /v1/t2a_v2

当你要把文本直接转换成音频,并且希望使用 MiniMax 兼容的请求与返回格式时,使用这个接口即可。

支持模型

  • speech-2.8-hd
  • speech-2.8-turbo
  • speech-2.6-hd
  • speech-2.6-turbo
  • speech-02-hd
  • speech-02-turbo

调用方式

API 端点

text
https://api.exchangetoken.ai

认证方式

MiniMax T2A 使用以下认证头:

text
x-key: YOUR_API_KEY

请求格式

text
Content-Type: application/json

请求路径

text
POST /v1/t2a_v2

核心请求字段

字段类型必填说明
modelstringTTS 模型名称
textstring输入文本,建议控制在 10000 字符以内
streamboolean是否启用流式返回
voice_settingobject语音配置,必须包含 voice_id
audio_settingobject音频编码参数
language_booststring语言提示,例如 autoEnglishChinese
pronunciation_dictobject自定义发音映射
voice_modifyobject音色、强度、音效调节
subtitle_enableboolean是否输出字幕
subtitle_typestringsentencewordword_streaming
output_formatstring非流式支持 hexurl,流式返回 hex 分片

非流式调用示例

bash
curl -X POST "https://api.exchangetoken.ai/v1/t2a_v2" \
  -H "x-key: YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "text": "欢迎使用 Exchange Token,这是一段 MiniMax 文本转语音示例。",
    "stream": false,
    "language_boost": "auto",
    "output_format": "hex",
    "voice_setting": {
      "voice_id": "English_Graceful_Lady",
      "speed": 1,
      "vol": 1,
      "pitch": 0
    },
    "audio_setting": {
      "sample_rate": 32000,
      "bitrate": 128000,
      "format": "mp3",
      "channel": 1
    }
  }'

非流式返回示例

json
{
  "data": {
    "audio": "<hex encoded audio>",
    "status": 2
  },
  "extra_info": {
    "audio_length": 11124,
    "audio_sample_rate": 32000,
    "audio_size": 179926,
    "bitrate": 128000,
    "word_count": 163,
    "invisible_character_ratio": 0,
    "usage_characters": 163,
    "audio_format": "mp3",
    "audio_channel": 1
  },
  "trace_id": "01b8bf9bb7433cc75c18eee6cfa8fe21",
  "base_resp": {
    "status_code": 0,
    "status_msg": "success"
  }
}

流式调用示例

bash
curl -N -X POST "https://api.exchangetoken.ai/v1/t2a_v2" \
  -H "x-key: YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "text": "这次请求会以流式方式返回音频分片。",
    "stream": true,
    "output_format": "hex",
    "voice_setting": {
      "voice_id": "English_Insightful_Speaker",
      "speed": 1,
      "vol": 1,
      "pitch": 0
    },
    "audio_setting": {
      "sample_rate": 32000,
      "bitrate": 128000,
      "format": "mp3",
      "channel": 1
    }
  }'

stream=true 时,服务端会持续返回多个分片。中间分片通常是 data.status = 1,最后一个分片是 data.status = 2

流式分片示例

json
{
  "data": {
    "audio": "<hex encoded audio chunk>",
    "status": 1
  },
  "trace_id": "01b8bf9bb7433cc75c18eee6cfa8fe21",
  "base_resp": {
    "status_code": 0,
    "status_msg": ""
  }
}

语音与音频参数

voice_setting

字段类型必填说明
voice_idstring目标音色 ID
speednumber范围 0.52
volnumber范围 (0, 10]
pitchinteger范围 -1212
emotionstring情绪风格

audio_setting

字段类型必填说明
sample_rateinteger80001600022050240003200044100
bitrateinteger3200064000128000256000
formatstringmp3pcmflacwavpcmu_rawpcmu_wavopus
channelinteger1 为单声道,2 为双声道

返回字段说明

字段说明
data.audio生成的音频内容
data.status1 表示生成中,2 表示生成完成
extra_info.usage_characters本次合成的计费字符数
trace_id请求追踪 ID
base_resp.status_code请求状态码,0 表示成功

错误返回格式

json
{
  "base_resp": {
    "status_code": 1004,
    "status_msg": "authentication failed"
  }
}

常见含义:

  • 0:成功
  • 1002:请求频率超限
  • 1004:鉴权失败
  • 1039:TPM 超限
  • 1042:无效字符占比超限
  • 2013:输入参数非法

说明

  • 文本较长时,建议优先使用流式模式,以便更快拿到首段音频。
  • 非流式模式下,output_format 支持 hexurl
  • 流式模式下,音频会以 hex 分片形式持续返回。
  • 如需排查请求问题,请保留 trace_id