/audio/transcriptions 发送一个音频文件,选择转录模型,并指定所需的响应格式。
在处理对话录音?用语音转文本生成会议纪要从一个音频文件出发,得到能精确引用达成时刻(精确到秒)的决策和行动项,还包括哪些模型会返回分段时间戳,以及如何处理一份从不说明谁在发言的转录文本。
基本用法
支持的输入
常见音频格式包括mp3、mp4、mpeg、mpga、m4a、wav、webm、flac 和 ogg。请查阅 语音转文本模型 页面了解当前模型支持情况和价格。
响应格式
生产环境建议
- 尽量保证音频清晰,避免多人同时说话。
- 如果工作流需要更低延迟或更方便重试,可将过长的录音切分为较小的片段。
- 为每份转录保存原始音频路径、模型 ID 和响应格式,便于审计。