Referencia de la API

Generación de Video SeeDance

Llama a los modelos Volcengine Ark Doubao Seedance a través de TENSORAXIS — texto a video, imagen a video, primer/último fotograma, referencia/continuación de video, además de los parámetros avanzados de metadata y la facturación.

SeeDance es la integración de TENSORAXIS de los modelos de video Volcengine Ark Doubao Seedance (canal doubao-video). Como todo modelo de video, es asíncrono: se envía una tarea para obtener un task_id, se consulta el estado de la tarea y luego se lee la URL del video tras su finalización. El flujo compartido de envío/consulta se encuentra en la descripción general de Generación de Video; esta página cubre únicamente las capacidades y parámetros específicos de SeeDance.

Utiliza los campos de solicitud de TENSORAXIS prompt, images y metadata; el relay los traduce a la forma de tarea de generación de contenido de Volcengine. No envíes directamente el cuerpo content[] de nivel superior de upstream a /v1/video/generations, o TENSORAXIS no encontrará un prompt y devolverá 400 prompt is required.

Modelos y Matriz de Capacidades

ModeloTexto a videoImagen a video (primer fotograma)Primer/último fotogramaReferencia multimodal (imagen/video/audio)Audio nativo
doubao-seedance-1-0-lite-t2v
doubao-seedance-1-0-lite-i2v
doubao-seedance-1-0-pro-250528
doubao-seedance-1-5-pro-251215
doubao-seedance-2-0-260128
doubao-seedance-2-0-fast-260128

2-0-fast iguala a 2-0 en capacidad, pero está optimizado para una generación más rápida. El soporte de capacidades está definido en última instancia por el modelo upstream.

Campos de Solicitud

POST /v1/video/generations

CampoTipoRequeridoDescripción
modelstringNombre del modelo SeeDance (ver la tabla anterior)
promptstringPrompt de video; si está vacío devuelve 400 prompt is required
imagesstring[]NoURLs de imágenes de referencia para imagen a video (primer fotograma); las referencias múltiples también van aquí
imagestringNoURL de una única imagen de referencia; se normaliza en images cuando images está vacío
secondsstringNoDuración en segundos; un entero positivo se mapea al duration de upstream, equivalente a metadata.duration
metadataobjectNoParámetros avanzados de SeeDance — ver parámetros avanzados de metadata

Texto a Video

Proporciona solo prompt; agrega resolución, duración, relación de aspecto, etc. mediante metadata.

curl https://api.tensoraxis.com/v1/video/generations \
  -H "Authorization: Bearer $TENSORAXIS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "doubao-seedance-2-0-260128",
    "prompt": "An old man wearing a hat smiles and walks forward down an autumn street",
    "metadata": {
      "resolution": "1080p",
      "ratio": "16:9",
      "duration": 5
    }
  }'

Imagen a Video

Primer fotograma

Pasa una imagen de referencia mediante images para usarla como el primer fotograma; los demás parámetros coinciden con texto a video.

curl https://api.tensoraxis.com/v1/video/generations \
  -H "Authorization: Bearer $TENSORAXIS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "doubao-seedance-1-0-lite-i2v",
    "prompt": "Slow push-in, the subject smiles",
    "images": ["https://example.com/first-frame.jpg"],
    "metadata": {
      "resolution": "1080p",
      "duration": 5
    }
  }'

Primer/último fotograma (Seedance 2.0)

El primer/último fotograma requiere que metadata.content etiquete cada imagen con un role explícito (first_frame / last_frame); esto sobrescribe la lista de contenido generada a partir de images. Ver forma de metadata.content.

{
  "model": "doubao-seedance-2-0-260128",
  "prompt": "A time-lapse from dawn to sunset",
  "metadata": {
    "resolution": "1080p",
    "duration": 5,
    "content": [
      { "type": "image_url", "image_url": { "url": "https://example.com/start.jpg" }, "role": "first_frame" },
      { "type": "image_url", "image_url": { "url": "https://example.com/end.jpg" }, "role": "last_frame" }
    ]
  }
}

Referencia/Continuación de Video (equivalente a "edición de video")

El backend de SeeDance no tiene un endpoint dedicado de edición de video a nivel de fotograma. La capacidad de "referencia multimodal de video" de Seedance 2.0 te permite proporcionar un video como fuente de referencia/continuación — pasa un elemento de metadata.content con video_url.

{
  "model": "doubao-seedance-2-0-260128",
  "prompt": "Continue the motion in this clip, the camera keeps panning right",
  "metadata": {
    "resolution": "1080p",
    "content": [
      { "type": "video_url", "video_url": { "url": "https://example.com/source.mp4" } }
    ]
  }
}

Cuando una solicitud contiene entrada de video, TENSORAXIS la clasifica como "entrada de video" según el contenido multimedia real (no la declaración de metadata) y la factura bajo el nivel más económico — ver Facturación. Si necesitas edición de video a nivel de fotograma (reemplazar/repintar segmentos específicos), usa edición de video HappyHorse (happyhorse-1.0-video-edit) en su lugar.

Parámetros Avanzados de metadata

Los campos bajo metadata se mapean a campos de nivel superior de la tarea de Volcengine. La columna "Rango / Predeterminado" proviene de la documentación oficial de Volcengine y está definida en última instancia por el modelo upstream; TENSORAXIS solo recibe y reenvía estos campos.

CampoReenviado comoTipoRango / PredeterminadoDescripción
resolutionresolutionstring480p / 720p / 1080p / 2k, predeterminado 1080pResolución de salida
ratioratiostring16:9 / 9:16 / 4:3 / 3:4 / 21:9 / 1:1 / adaptiveRelación de aspecto
durationdurationinteger415, predeterminado 5Duración en segundos; equivalente al seconds de nivel superior
framesframesintegerDefinido por el modeloNúmero total de fotogramas (vinculado a fps/duración)
seedseedintegerSemilla aleatoriaFija la aleatoriedad para reproducir resultados
camera_fixedcamera_fixedbooleanPredeterminado falseSi se debe fijar la cámara
watermarkwatermarkbooleanPredeterminado falseSi se debe agregar una marca de agua
generate_audiogenerate_audiobooleanPredeterminado falseGenerar audio nativo (Seedance 2.0)
return_last_framereturn_last_framebooleanPredeterminado falseDevolver la imagen del último fotograma
draftdraftbooleanPredeterminado falseModo borrador/vista previa
service_tierservice_tierstringDefinido por el modeloNivel de servicio
execution_expires_afterexecution_expires_afterintegerDefinido por el modeloExpiración de la tarea (segundos)
callback_urlcallback_urlstringURL de callback al finalizar la tarea
toolstoolsarrayConfiguración de herramientas (p. ej. búsqueda web)
contentcontentarrayArray de contenido avanzado, ver abajo

Notas:

  • metadata.model se elimina y no puede sobrescribir el modelo facturado.
  • Las claves de metadata que no se mapean a los campos anteriores generalmente no se reenvían a upstream.
  • Si se envían tanto seconds como metadata.duration, metadata.duration prevalece.

Forma de metadata.content

metadata.content es un array de contenido avanzado utilizado para primer/último fotograma, referencia de video, referencia de audio, etc. Una vez proporcionado, sobrescribe la lista de contenido generada a partir de images (cualquier elemento type: text se ignora; el cuerpo proviene de prompt).

Tipo de elementoCamposRestricciones oficiales (definidas por upstream)
image_urlimage_url.url, role opcionalImagen ≤30MB, ≤9 elementos; role es para primer/último fotograma
video_urlvideo_url.urlVideo 2–15s, ≤3 clips
audio_urlaudio_url.urlAudio ≤15MB, ≤3 clips
texttextIgnorado; el cuerpo proviene del prompt de nivel superior

Facturación

SeeDance se factura por token; la resolución ya está reflejada en el conteo de tokens, por lo que no se aplica un coeficiente de resolución independiente.

  • La generación estándar (texto/imagen a video) utiliza el nivel generate.
  • La entrada de video (referencia/continuación de video) se detecta a partir del contenido multimedia real y cae en el nivel de descuento video_input más económico (precio unitario más bajo que la generación estándar).

Los precios unitarios exactos siguen la configuración de "Precios de Video" de la consola y la página de precios; los operadores pueden sobrescribir los valores predeterminados con las tarifas oficiales más recientes.

Consulta de Tareas

El flujo compartido de envío/consulta, los códigos de estado y las rutas de obtención compatibles con OpenAI/Sora se encuentran en la descripción general de Generación de Video.