Blog

Seedance 2.5 vs 2.0: la mejora está en las entradas, no en los píxeles, y la factura que se triplica

Publicado 2026-08-10 · Datos medidos 2026-08-08

Operamos un servicio de generación de vídeo con varios modelos, lo que significa que pagamos de nuestro bolsillo la factura de cada generación de cada modelo que ponemos en producción. Antes de añadir Seedance 2.5 al catálogo junto a Seedance 2.0, pasamos ambos por el mismo banco de medición que usamos para decidir el enrutado. Este artículo es esa tanda de datos, publicada tal como se midió.

Todo lo que viene a continuación sale de ejecuciones directas contra la API entre el 2026-08-08 y el 2026-08-10, facturadas a nuestra propia cuenta. Cuando solo tenemos una ejecución, lo decimos. Cuando una cifra nos sorprendió, la repetimos antes de creérnosla.

TL;DR

  • A igual duración y en la ruta más barata que medimos para cada uno, Seedance 2.5 cuesta por clip alrededor de 1.7 veces lo que cuesta Seedance 2.0.
  • La mejora de titular no es la calidad por segundo, es la libertad de entrada: 2.5 acepta hasta 30 imágenes de referencia, 10 vídeos de referencia y 10 pistas de audio de referencia, y estira la salida hasta 30 segundos. 2.0 se queda en el control del primer y el último fotograma.
  • El vídeo de referencia se factura igual que el vídeo de salida, segundo a segundo. Adjunta un clip de 12.6 s a una generación de 5 s y pagas 17.6 segundos facturados. Confirmamos el mecanismo, no solo el precio: dos ejecuciones con el mismo clip de referencia a distinta duración de salida, más el proveedor declarando por su cuenta billing_rule: "per_second" en la respuesta de creación.
  • Si tu carga es texto a vídeo puro de 5 s, 2.0 sigue siendo el valor por defecto racional. 2.5 empieza a justificar su sobreprecio en el momento en que entra un segundo material de entrada en el encargo.

Qué cambió de verdad

Seedance 2.0Seedance 2.5
Texto a vídeo
Imagen a vídeoprimer fotograma, o primero y últimosí, y además referencia con varias imágenes
Imágenes de referencia2 (primera y última)hasta 30, direccionables por orden
Vídeo de referencianohasta 10 clips
Audio de referencianohasta 10 pistas
Duración máxima de salida15 s30 s
Narración en varios planosno

Las entradas de referencia son direccionables por orden: el prompt habla de «imagen 3» o «vídeo 1» y el modelo lo resuelve contra el orden en que las enviaste. Eso convierte el orden de los materiales en parte del prompt, con consecuencias de producto si construyes encima (nosotros tuvimos que rehacer la interfaz de subida alrededor de esto).

Medido: coste por ejecución

Mismo prompt, 5 segundos, 480p, un clip por ejecución. Los precios son lo que se cobró realmente a nuestra cuenta, en USD, el 2026-08-08.

ModeloRuta ARuta B
Seedance 2.0 texto a vídeo$0.290sin volver a medir
Seedance 2.5 texto a vídeo$0.484$0.687
Seedance 2.5 imagen a vídeo$0.484$0.687
Seedance 2.5 con un vídeo de referencia de 12.63 s$2.203$1.485

Hay dos cosas que merece la pena mirar.

Primero, las dos rutas de 2.5 no se ponen de acuerdo sobre qué modo sale barato. La ruta A es un 29% más barata en texto a vídeo puro, pero un 48% más cara en cuanto se adjunta un vídeo de referencia. Si mandas todo el tráfico de Seedance 2.5 por un solo proveedor porque ganó la comparación de texto a vídeo, pagas de más en cada trabajo con vídeo de referencia. Acabamos enrutando por modo, no por modelo.

Segundo, la ejecución con vídeo de referencia cuesta entre 2.2 y 3.2 veces la ejecución simple. No es un recargo, es aritmética, y eso nos lleva a la parte que no encontramos documentada en ningún sitio.

El mecanismo de facturación del vídeo de referencia, fijado con dos ejecuciones

La página de precios del modo con vídeo de referencia dice «por segundo» sin especificar qué segundos. ¿Solo la salida? ¿Salida más entrada? ¿Un recargo fijo? La diferencia decide si un servicio como el nuestro cobra la mitad de lo que debe, así que lo medimos.

Método: mismo clip de referencia de 12.67 s, mismo prompt, misma resolución, dos ejecuciones, duración de salida de 5 s y luego de 10 s. Lectura del saldo de la cuenta justo antes y justo después de cada llamada de creación.

SalidaFacturadoSegundos facturadosTarifa por segundo
5 s216.5561 créditos17.6712.2556
10 s277.7302 créditos22.6712.2510

La tarifa por segundo coincide entre ambas ejecuciones con un margen del 0.04%, pero solo si cuentas los segundos facturados como salida más entrada de referencia. La respuesta de creación del proveedor además lo declara sola, cosa que no esperábamos:

"usage": { "billing_rule": "per_second", "credits_reserved": 277.7302 }

Si derivas por separado la tarifa del segundo de referencia, sale 1.0024 veces la tarifa del segundo de salida. El segundo de referencia y el de salida valen lo mismo.

Hay un pliegue más: la tarifa por segundo cambia según el modo. En el mismo proveedor, el texto a vídeo puro va a $0.1374 por segundo de salida mientras que el modo con vídeo de referencia va a $0.0842 por segundo facturado. El modo de referencia es una tarifa rebajada aplicada a un número de segundos mayor.

Consecuencia práctica: una generación de 5 s con un clip de referencia de 12.6 s factura 17.6 segundos. Si cobras a tus usuarios solo por la duración de salida, te comes un 54% de cobro de menos en ese trabajo. Reconstruimos nuestra tarificación para facturar los segundos de entrada en el servidor (sondeados con ffmpeg, nunca aceptados del cliente) antes de habilitar el modo.

Qué produce de verdad la generación con varias referencias: tres ejemplos

Los números describen el coste. No enseñan si el modelo sigue un plan de rodaje. Generamos tres clips de muestra por la cadena de referencia y publicamos aquí las entradas, los prompts completos (en cada página de modelo) y las salidas en bruto, para que contrastes nuestra lectura con la tuya.

Ejemplo 1: un plano secuencia de 30 segundos a partir de cuatro fotos de producto

Entraron cuatro imágenes de referencia: vista frontal, detalle lateral, estuche de carga y un expositor vacío. Este clip es una repetición, y el primer intento fallido nos enseñó más que el bueno: nuestro primer prompt guionizaba cuatro tiempos con código de tiempo («a los 6 segundos se abre la tapa») y el modelo respondió con siete segundos muertos de apertura, una tapa que se deformaba en vez de girar sobre la bisagra y un producto incapaz de sostener su forma. La revisión fotograma a fotograma lo rechazó. El prompt revisado redujo cuatro tiempos a tres movimientos que comparten un único movimiento de cámara continuo, y añadió restricciones duras contra los cambios de forma.

Imagen de referencia 1: auriculares de frenteImagen de referencia 2: detalle lateral del auricularImagen de referencia 3: estuche de cargaImagen de referencia 4: expositor vacío

Fotograma a fotograma sobre la repetición (2026-08-19): la tapa se levanta sobre su bisagra real mientras el estuche se queda quieto, el auricular mantiene una forma constante desde que se eleva hasta el último fotograma, y la órbita, la elevación y el retroceso se leen como un solo plano, sin tiempos muertos ni cortes. La lección transferible del primer intento fallido: las listas de tiempos con código de tiempo invitan a cambios de estado bruscos; menos movimientos compartiendo un único movimiento de cámara continuo, más restricciones explícitas contra la deformación, es lo que sostuvo un plano secuencia de 30 segundos.

Ejemplo 2: un personaje montado a partir de cuatro fuentes

Entradas: una hoja de personaje de cuerpo entero, un primer plano de la cara, una foto cenital de la chaqueta y una localización de templo vacía. La salida tenía que mantener las cuatro coherentes en movimiento.

Imagen de referencia 1: personaje de cuerpo enteroImagen de referencia 2: primer plano de la caraImagen de referencia 3: chaqueta en plano cenitalImagen de referencia 4: localización del templo

Lo que aguantó de un fotograma a otro en nuestra revisión de esta ejecución: la trenza, las pecas, las hebillas y los pespuntes de la chaqueta y los haces de luz del arco que venían de la placa de localización. El tiempo guionizado de la mirada hacia arriba cae cerca de la marca de los 5 s. Es una ejecución, no un banco de pruebas de coherencia; se publica como prueba de lo que puede sostener una sola pasada.

Ejemplo 3: movimiento de cámara transferido desde un vídeo de referencia

El conjunto de referencia aquí fue un vídeo (un arco liso de 180 grados alrededor de un cubo gris, 8.2 s, que se facturó como segundos de entrada de referencia según el mecanismo de arriba) más una foto fija de una tetera. La instrucción: copia el movimiento, cambia el sujeto, no muevas nada más.

Imagen de referencia 1: tetera de cerámica

La salida mantiene un arco a altura constante alrededor de la tetera a un ritmo cercano al de la referencia, y el único movimiento añadido es el vapor que pedía el prompt. El arco se lee más o menos como los 180 grados guionizados. La transferencia de movimiento junto con el cambio de sujeto funcionó al primer intento en esta ejecución.

Medido: latencia

Tres ejecuciones para cada texto a vídeo, una sola para cada imagen a vídeo, tiempo real desde la creación hasta la salida terminada, 2026-08-08.

Modelo, modoEjecuciones (segundos)
Seedance 2.5 texto a vídeo, ruta A92 / 149 / 187
Seedance 2.5 texto a vídeo, ruta B132 / 135 / 274
Seedance 2.5 imagen a vídeo, ruta A317
Seedance 2.5 imagen a vídeo, ruta B149
Seedance 2.0 texto a vídeo~220 (dos ejecuciones)

La dispersión importa más que la mediana. La ejecución más rápida de 2.5 batió todo lo que hemos medido en la familia Seedance, y la más lenta tardó el triple. Si enseñas una estimación de tiempo a tus usuarios, presupuesta la dispersión, no el caso ideal. La ejecución de imagen a vídeo de 317 segundos en la ruta A se repitió con bastante constancia entre comprobaciones, así que enrutamos imagen a vídeo por otro lado.

Dónde 2.0 sigue siendo la elección correcta

Una comparación honesta tiene que incluir esta sección.

  • Texto a vídeo simple de 5 s: 2.0 entrega al 60% del precio más barato medido de 2.5. Si el encargo no lleva materiales de referencia, el sobreprecio no te compra nada.
  • Morphs entre primer y último fotograma: el contrato posicional de dos imágenes de 2.0 está maduro y ha sobrevivido a nuestras pruebas de humo en producción desde junio. 2.5 puede expresar lo mismo con su lista de referencias, pero es un camino más nuevo y con menos kilómetros.
  • Latencia predecible: las dos ejecuciones medidas de 2.0 quedaron a segundos una de otra. La dispersión de 2.5 es de 2 a 3 veces.

Limitaciones, para que lo peses bien

  • Las muestras son pequeñas: tres ejecuciones por ruta en texto a vídeo, una por ruta en imagen a vídeo, dos para el experimento de facturación. Son datos para decidir enrutado, no un artículo de benchmark.
  • Todas las cifras de coste de 2.5 se midieron a 480p y entre 5 y 10 segundos. No hemos medido el techo de 30 segundos.
  • Los precios son lo que rutas de API agregadas cobraron a nuestra cuenta en las fechas indicadas. Los precios de empresa en directo pueden diferir. Los proveedores cambian precios sin avisar.
  • No hicimos una comparación controlada de calidad visual. Este artículo cubre coste, latencia y mecánica de facturación, que es lo que se puede medir sin un jurado.

Método

Todas las ejecuciones pasan por el mismo banco que usamos para decidir enrutado: llamadas HTTP directas a la API de tareas de cada proveedor, sin capa de SDK, con los sobres de respuesta registrados en bruto. Los costes se calculan a partir de las diferencias de saldo leídas justo antes y justo después de cada llamada de creación, no de listas de precios. La latencia es el tiempo real entre la creación de la tarea y el primer sondeo que devuelve una salida terminada. El experimento de facturación del vídeo de referencia se describe más arriba.

Los dos modelos están en producción en Vidney: Seedance 2.5 y Seedance 2.0. Enrutamos cada modo al proveedor que mejor midió para ese modo, que es la razón entera de que estos datos existan.