音频与实时
彼源 AI 提供文本转语音、音频转录、音频翻译和实时连接四种能力。模型 ID 从模型广场复制;想确认当前令牌实际可用的模型,调用 GET /v1/models(令牌设置了模型限制时,以这个返回为准)。本页示例中的 tts-1、whisper-1 等只是示例,实际可用模型以模型广场为准。
| 能力 | 端点 | 做什么 |
|---|---|---|
| 文本转语音 | POST /v1/audio/speech | 文本生成音频 |
| 音频转录 | POST /v1/audio/transcriptions | 音频转成原语言文本 |
| 音频翻译 | POST /v1/audio/translations | 音频翻译成英文文本 |
| 实时对话 | GET /v1/realtime | WebSocket 实时语音 / 对话 |
文本转语音
把 <YOUR_TOKEN> 换成你的令牌(sk- 开头,在控制台令牌管理创建)。
curl https://api.biyuan.ai/v1/audio/speech \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <YOUR_TOKEN>" \
-d '{
"model": "tts-1",
"input": "欢迎使用彼源 AI。",
"voice": "alloy"
}' \
--output speech.mp3
这个接口成功时直接返回音频流,不是 JSON,调用侧要按文件或流处理。
音频转录
curl https://api.biyuan.ai/v1/audio/transcriptions \
-H "Authorization: Bearer <YOUR_TOKEN>" \
-F "file=@/absolute/path/to/sample.mp3" \
-F "model=whisper-1" \
-F "response_format=json"
首次验证用短音频、清晰人声、response_format=json,最容易看出链路是否正常。
音频翻译
curl https://api.biyuan.ai/v1/audio/translations \
-H "Authorization: Bearer <YOUR_TOKEN>" \
-F "file=@/absolute/path/to/sample.mp3" \
-F "model=whisper-1"
要保留原语言就用 transcriptions;要翻译成英文才用 translations。
Realtime 实时连接
/v1/realtime 是 WebSocket 端点,不是普通 HTTP 接口,要用 WebSocket 客户端连接:
wss://api.biyuan.ai/v1/realtime?model=gpt-4o-realtime-preview
连接时确认三点:用的是 WebSocket 协议、model 查询参数已填、连接时同样使用你的 sk- 令牌鉴权(具体传参方式以你所用 SDK/客户端的 Realtime 接入说明为准)。
排错
如果聊天能用、音频不能用,多半是当前分组或模型权限没开放音频模型,先在模型广场确认模型再排接口。