版本: v1.0.0 | 更新日期: 2026-07-15 | 模型: scribe_v2, scribe_v2_realtime | 状态: GA 本文档基于正式环境( https://platform.dataeyes.ai)线上实测请求/响应编写,所有字段名、类型、取值均与实际 API 返回严格一致。
| 场景 | 模型 | 协议 | 适用于 |
|---|---|---|---|
| 录音文件转写 | scribe_v2 | HTTP (multipart/form-data) | 已有完整音频文件的离线批量转写:会议录音、播客、客服质检等 |
| 实时流式转写 | scribe_v2_realtime | WebSocket | 边说边出字的低延迟场景:实时字幕、语音输入、会议纪要等 |
| 能力 | 说明 |
|---|---|
| 多语言识别 | 支持 90+ 种语言,自动检测语言并返回置信度 |
| 词级时间戳 | 每个词返回精确到毫秒级的 start / end 时间;实时模型额外返回字符级时间戳 |
| 说话人分离 (Diarization) | 多人对话音频自动标注 speaker_id |
| 置信度评分 | 每个词返回 logprob(对数概率),可用于质量过滤 |
| 实时增量输出 | WebSocket 会话中持续推送 partial_transcript(临时结果)与 committed_transcript(确认结果) |
Authorization: Bearer YOUR_API_KEY| 协议 | 携带方式 |
|---|---|
| HTTP | 请求头 Authorization: Bearer <API_KEY> |
| WebSocket | 握手请求头 Authorization: Bearer <API_KEY> |
安全提示:API Key 为敏感凭证,请勿在客户端代码、公开仓库或日志中暴露。建议通过环境变量或密钥管理服务注入。
| Model ID | 说明 | 协议 | 计费方式 | 状态 |
|---|---|---|---|---|
scribe_v2 | 录音文件转写模型。高精度、支持说话人分离与词级时间戳。 | HTTP | 按音频时长 | GA |
scribe_v2_realtime | 实时流式转写模型。低延迟增量输出,词级 + 字符级时间戳。 | WebSocket | 按音频时长 | GA |
两个模型均按音频时长计费(按量计费),与请求次数无关,计量规则见 7. 计费说明。具体单价以控制台模型价格页实时显示为准。
POST https://platform.dataeyes.ai/v1/elevenlabs/speech-to-text