跳到主要内容

音频与实时

彼源 AI 提供文本转语音、音频转录、音频翻译和实时连接四种能力。模型 ID 从模型广场复制;想确认当前令牌实际可用的模型,调用 GET /v1/models(令牌设置了模型限制时,以这个返回为准)。本页示例中的 tts-1whisper-1 等只是示例,实际可用模型以模型广场为准。

能力端点做什么
文本转语音POST /v1/audio/speech文本生成音频
音频转录POST /v1/audio/transcriptions音频转成原语言文本
音频翻译POST /v1/audio/translations音频翻译成英文文本
实时对话GET /v1/realtimeWebSocket 实时语音 / 对话

文本转语音

<YOUR_TOKEN> 换成你的令牌(sk- 开头,在控制台令牌管理创建)。

curl https://api.biyuan.ai/v1/audio/speech \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <YOUR_TOKEN>" \
-d '{
"model": "tts-1",
"input": "欢迎使用彼源 AI。",
"voice": "alloy"
}' \
--output speech.mp3

这个接口成功时直接返回音频流,不是 JSON,调用侧要按文件或流处理。

音频转录

curl https://api.biyuan.ai/v1/audio/transcriptions \
-H "Authorization: Bearer <YOUR_TOKEN>" \
-F "file=@/absolute/path/to/sample.mp3" \
-F "model=whisper-1" \
-F "response_format=json"

首次验证用短音频、清晰人声、response_format=json,最容易看出链路是否正常。

音频翻译

curl https://api.biyuan.ai/v1/audio/translations \
-H "Authorization: Bearer <YOUR_TOKEN>" \
-F "file=@/absolute/path/to/sample.mp3" \
-F "model=whisper-1"

要保留原语言就用 transcriptions;要翻译成英文才用 translations

Realtime 实时连接

/v1/realtime 是 WebSocket 端点,不是普通 HTTP 接口,要用 WebSocket 客户端连接:

wss://api.biyuan.ai/v1/realtime?model=gpt-4o-realtime-preview

连接时确认三点:用的是 WebSocket 协议、model 查询参数已填、连接时同样使用你的 sk- 令牌鉴权(具体传参方式以你所用 SDK/客户端的 Realtime 接入说明为准)。

排错

如果聊天能用、音频不能用,多半是当前分组或模型权限没开放音频模型,先在模型广场确认模型再排接口。

继续阅读