DataEyesAI
官网主页控制台文档首页快速开始开发工具大模型API
官网主页控制台文档首页快速开始开发工具大模型API
  1. 万相视频生成
  • OpenAI格式(支持各大原厂模型)
    • 聊天(Response)
      • 创建模型响应
      • 创建模型响应(流式返回)
      • 创建网络搜索
      • 创建模型响应 gpt-5启用思考
      • 创建函数调用
      • 创建模型响应 (控制思考长度)
    • ChatGPT接口
      • ChatGPT音频(Audio)
        • 音频转文字 gpt-4o-transcribe
        • GPT-4o-audio
        • 音频转文字 whisper-1
        • 音频转文字 gpt-4o-transcribe
        • 创建语音 gpt-4o-mini-tts
      • ChatGPT聊天(Chat)
        • 创建聊天识图 (非流)
        • 创建聊天识图 (流式)
        • 创建聊天识图 (流式) base64
        • 官方N测试
        • 创建结构化输出
        • 控制推理模型努力程度
        • 创建聊天函数调用
        • deepseek-ocr 识别
        • 创建聊天补全 (非流)
      • ChatGPT自动补全(Completions)
        • ChatGPT自动补全(Completions)
        • 创建完成
    • 图像
      • GPT Image 2
      • 图像编辑 API 文档
      • 文生图片
      • 创建聊天补全 (流式)
      • 创建聊天补全 qwen-mt-turbo
      • 创建聊天补全 deepseek v3.1思考程度 (流式)
    • 语音
      • 语音识别(audio)
      • 语音合成(audio)
      • 官方Function calling调用
      • 创建聊天创作图 (非流)
    • 向量化
      • 文本向量化
  • Anthropic格式
    • 聊天
    • 聊天(prompt cache)
    • 流式返回
    • 聊天(旧模型-深度思考)
    • 聊天(新模型-深度思考)
    • 工具调用(function call)
    • 分析图片
  • Midjourney格式
    • Midjourney API 接口文档
    • 01_文生图Imagine
    • 02_查询任务状态Fetch
    • 03_执行操作Action
    • 04_提交弹窗确认Modal
    • 05_编辑图片Edits
    • 06_多图混合Blend
    • 07_图生文Describe
    • 08_上传图片Upload
    • 09_换脸FaceSwap
    • 10_获取图片Seed
    • 11_批量查询任务
    • 12_获取生成图片Image
  • NanoBanana
    • Gemini请求方式
      • 生成图片
      • 编辑图片
  • 视频生成接口API
    • 豆包Seedance视频生成
      • 00-概述
      • 01-创建视频生成任务
      • 02-查询视频生成任务
      • 03-查询视频生成任务列表
      • 04-取消或删除视频生成任务
      • Seedance 私域素材库 API
    • 海螺Hailuo视频生成
      • 00-概述
      • 01-文生视频-T2V
      • 02-图生视频-I2V
      • 03-首尾帧生成视频-FL2V
      • 04-主体参考视频-S2V
      • 05-查询任务状态
      • 06-视频下载
      • 07-附录-运镜指令与回调
    • MiniMax-H3视频生成
      • 00-概述
      • 01-创建视频生成任务
      • 02-创建视频再生成任务
      • 03-创建H3-Context-IR任务
      • 04-查询任务
      • 05-查询任务列表
      • 06-取消或删除任务
    • 可灵AI视频生成
      • 00-概述
      • 01-文生视频
      • 02-图生视频
      • 03-视频Omni
      • 04-多图参考生视频
      • 05-动作控制
      • 06-多模态视频编辑
      • 07-视频延长
      • 08-对口型
      • 09-数字人
      • 10-文生音效
      • 11-视频配音效
      • 12-语音合成
      • 13-音色克隆
      • 14-图像识别
      • 15-主体管理
      • 16-视频特效
    • Vidu视频生成
      • 00-概述
      • 01-文生视频
      • 02-图生视频
      • 03-参考生视频
      • 04-首尾帧
      • 05-智能多帧
      • 06-场景特效模板
      • 07-模板成片
      • 08-查询任务
    • 即梦视频生成
      • 00-概述
      • 01-3.0Pro视频生成
      • 02-720P文生视频
      • 03-720P图生视频-首帧
      • 04-720P图生视频-首尾帧
      • 05-720P图生视频-运镜
      • 06-1080P文生视频
      • 07-1080P图生视频-首帧
      • 08-1080P图生视频-首尾帧
      • 09-错误码
    • Grok视频生成
      • 00-概述
      • 01-文生视频
      • 02-图生视频
      • 03-参考图生视频
      • 04-视频编辑
      • 05-视频延长
    • 万相视频生成
      • 00-概述
      • 01-文生视频
      • 02-图生视频
      • 03-参考生视频
      • 04-视频编辑
      • 05-首尾帧生视频
      • 06-动作迁移与视频换人
      • 07-数字人视频
      • 08-通用视频编辑-VACE
      • 09-查询任务
    • HappyHorse
      • HappyHorse文生视频
      • HappyHorse图生视频-基于首帧
      • HappyHorse参考生视频
      • HappyHorse视频编辑
    • 通用视频生成API
      • 通用视频生成 API 接口调用文档
  • 语音接口API文档
    • 语音接口API
    • Gemini TTS 调用API
    • Google DeepMind Lyria API文档
    • Elevenlabs Speech to Text API 文档
  • 豆包系列-绘画
    • doubao-seededit-3-0-i2i-250628
    • doubao-seedream-4-0-250828-文生图
    • doubao-seedream-4-0-250828-图生图
    • doubao-seedream-4-0-250828-多图生图
  • Rerank重排序模型
    • 重排序
  • 文生音乐Suno
    • 任务提交
      • 生成歌曲(灵感模式)
      • 生成歌曲(自定义模式)
      • 生成歌曲(续写模式)
      • 生成歌曲(歌手风格)
      • 生成歌曲(上传歌曲二次创作)
      • 生成歌曲(拼接歌曲)
      • 生成歌词
      • 歌曲拼接
    • 查询接口
      • 批量获取任务
      • 查询单个任务
  • flux系列
    • FLUX 图像生成 API
    • flux-kontext-max
  • 谷歌Gemini接口
    • 原生格式
      • 文生图片 控制宽高比 +清晰度
      • 生成图片
      • 文本生成
      • 文本生成-流
      • 文本生成+思考-流
      • 图片生成
      • 格式化输出
      • 函数调用
      • 文档理解
      • URL context [原生格式]
      • 代码执行
      • 视频理解
      • URL context
      • 视频理解-url [原生格式]
      • Imagen 4
      • 音频理解
      • Embeddings
      • 聊天
      • 编辑图片
    • 图生图Base64请求方式
      • 多图融合片生成 gemini-3-pro-image-preview 控制宽高比 +清晰度
      • 图片编辑
      • 单图片 gemini-3-pro-image-preview 控制宽高比 +清晰度
      • 图片生成 gemini-2.5-flash-image
      • 图片生成 gemini-2.5-flash-image 控制宽高比
      • 图片理解
    • 图生图URL请求返回 URL请求格式OpenAI
      • 单图生图 gemini-3-pro-image-preview 控制宽高比 +清晰度
      • 多图融合片生成 gemini-3-pro-image-preview 控制宽高比 +清晰度
      • 图片理解
  1. 万相视频生成

07-数字人视频

数字人视频#

文档版本:v1.0.0 | 最后更新:2026-07-22
本平台已完整适配通义万相(Wan)官方视频生成接口,请求与响应均为透传,参数语义与官方一致。
基于单张人物图片 + 一段人声音频,生成口型、表情、动作与音频同步的说话、唱歌、表演视频。支持真人(肖像/半身/全身)及卡通人物形象。
本文档包含两个接口:
接口模型调用方式
数字人视频生成wan2.2-s2v异步(创建任务 + 轮询查询)
人脸检测wan2.2-s2v-detect同步(立即返回结果)
推荐流程:先调用人脸检测接口确认图片合规(check_pass: true),再提交数字人视频生成任务,可避免因图片不合规导致任务失败。

一、数字人视频生成(wan2.2-s2v)#

创建任务#

POST https://platform.dataeyes.ai/ali/api/v1/services/aigc/image2video/video-synthesis

请求头#

参数类型必填默认值说明
Content-Typestring是application/json数据交换格式
Authorizationstring是鉴权信息,Bearer {API_KEY}
官方要求的 X-DashScope-Async: enable 头由平台自动补充,调用时无需携带;携带亦兼容。

请求体#

参数类型必填默认值说明
modelstring是固定为 wan2.2-s2v
input.image_urlstring是人物图片 URL,需公网可访问的 HTTP/HTTPS 链接。要求见下方「图片与音频要求」
input.audio_urlstring是人声音频 URL,需公网可访问的 HTTP/HTTPS 链接。要求见下方「图片与音频要求」
parameters.resolutionstring否480P输出分辨率档位,可选 480P、720P。输出保持与输入图片相同宽高比,总像素调整至所选档位附近(480P 约 31 万像素,720P 约 92 万像素;例如 4:5 的输入图选 480P 可能输出 480×600)
parameters.stylestring否对口型场景,如 speech(说话)。官方描述支持说话、唱歌、表演三种场景,唱歌/表演的枚举值官方未公开,建议以实测为准

视频时长规则#

生成视频时长 = 输入音频时长,不通过参数指定:
音频时长须 小于 20 秒,超过将导致任务报错;
如需更长的视频,请将音频按每段小于 20 秒切分,分别生成后再拼接。

图片与音频要求#

输入要求
图片格式 jpg/jpeg/png/bmp/webp;宽、高均在 [400, 7000] 像素范围内;建议单人、正面、清晰的人物肖像图(可先用人脸检测接口预检)
音频格式 wav/mp3;文件小于 15MB,时长小于 20 秒;需包含清晰响亮的人声,建议去除环境噪音与背景音乐

请求示例(480P)#

curl --request POST \
  --url 'https://platform.dataeyes.ai/ali/api/v1/services/aigc/image2video/video-synthesis' \
  --header 'Authorization: Bearer <token>' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "wan2.2-s2v",
    "input": {
      "image_url": "https://example.com/portrait.jpg",
      "audio_url": "https://example.com/speech.mp3"
    },
    "parameters": {
      "resolution": "480P",
      "style": "speech"
    }
  }'

请求示例(720P)#

curl --request POST \
  --url 'https://platform.dataeyes.ai/ali/api/v1/services/aigc/image2video/video-synthesis' \
  --header 'Authorization: Bearer <token>' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "wan2.2-s2v",
    "input": {
      "image_url": "https://example.com/portrait.jpg",
      "audio_url": "https://example.com/sing.wav"
    },
    "parameters": {
      "resolution": "720P",
      "style": "speech"
    }
  }'

创建响应示例#

{
  "output": {
    "task_status": "PENDING",
    "task_id": "0385dc79-5ff8-4d82-bcb6-xxxxxx"
  },
  "request_id": "4909100c-7b5a-9f92-bfe5-xxxxxx"
}

用量与计费说明#

任务成功后,查询接口返回的 usage 中:
usage.duration:生成视频时长(秒),与输入音频时长一致,为计费依据;
usage.SR:输出分辨率档位(480 或 720),不同档位单价不同,720P 高于 480P。
数字人视频按成功生成的视频秒数与分辨率档位计费,输入不计费;任务失败或处理错误不计费。生成耗时通常约 5–10 分钟,建议以 15 秒左右间隔轮询查询接口。

二、人脸检测(wan2.2-s2v-detect)#

预检输入图片是否满足数字人视频生成的人物肖像规范(如清晰度、单人、正面),返回是否通过及是否检测到人像。
POST https://platform.dataeyes.ai/ali/api/v1/services/aigc/image2video/face-detect
本接口为同步接口,检测结果随响应立即返回,不产生 task_id,无需轮询查询。

请求头#

参数类型必填默认值说明
Content-Typestring是application/json数据交换格式
Authorizationstring是鉴权信息,Bearer {API_KEY}

请求体#

参数类型必填默认值说明
modelstring是固定为 wan2.2-s2v-detect
input.image_urlstring是待检测图片 URL,需公网可访问的 HTTP/HTTPS 链接。格式 jpg/jpeg/png/bmp/webp;宽、高均在 [400, 7000] 像素范围内

请求示例#

curl --request POST \
  --url 'https://platform.dataeyes.ai/ali/api/v1/services/aigc/image2video/face-detect' \
  --header 'Authorization: Bearer <token>' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "wan2.2-s2v-detect",
    "input": {
      "image_url": "https://example.com/portrait.jpg"
    }
  }'

响应示例#

检测通过:
{
  "output": {
    "check_pass": true,
    "humanoid": true
  },
  "usage": {
    "image_count": 1
  },
  "request_id": "c56f62df-xxxx-xxxx-xxxx-xxxxxx"
}
检测不通过:
{
  "output": {
    "check_pass": false,
    "humanoid": false,
    "code": "xxx",
    "message": "xxx"
  },
  "usage": {
    "image_count": 1
  },
  "request_id": "c56f62df-xxxx-xxxx-xxxx-xxxxxx"
}

响应字段#

字段类型说明
output.check_passboolean检测结果:true 通过,可用于数字人视频生成;false 不通过
output.humanoidboolean是否检测到人像
output.code / output.messagestring仅检测不通过时返回原因;通过时无此字段
usage.image_countinteger本次检测的图片数量,固定为 1,为计费依据
request_idstring本次请求唯一 ID
人脸检测按检测图片张数计费:请求成功即计费(无论检测是否通过),请求失败不计费。

查询任务#

数字人视频生成(wan2.2-s2v)为异步任务,创建后通过 task_id 轮询状态及结果(人脸检测为同步接口,无需查询):
GET https://platform.dataeyes.ai/ali/api/v1/tasks/{task_id}
详见 09-查询任务。
上一页
06-动作迁移与视频换人
下一页
08-通用视频编辑-VACE