Qué significa de verdad
Extender vídeo no entiende lo que pasa en tu escena. Extrapola un vector.
Así lo describe el propio blog de ByteDance: el modelo lee los frames finales del clip y continúa preservando personajes, entorno y ritmo.
Fíjate en qué palabra no aparece: intención. Ni narrativa. El modelo sigue trayectoria — dirección y velocidad — no guion.
Es el mismo defecto de Tiangong Ultra escalado a software. Un robot de sprint sabe acelerar en línea recta. No sabe leer una colchoneta y decidir "aquí toca frenar". Extender vídeo sabe continuar un movimiento. No sabe leer un muro, una meta o un giro de guion y decidir "aquí toca parar".
En el mismo hilo de Hacker News, el usuario globular-toast lo ilustra con un ejemplo tonto pero exacto:
"Errores de continuidad... la caja que contiene un regalo, y el regalo no cabe dentro." — globular-toast, Hacker News
El modelo seguía el gesto de la mano. No entendía el objeto.
Y hay una pregunta que ninguna guía SEO sobre Seedance se hace: ¿por qué todas explican esto como "entiende la trayectoria" en lugar de "extrapola el vector de movimiento"? Porque entender vende tutoriales. Extrapolar asusta a cualquiera que necesite control narrativo real — que es, no por casualidad, el mismo debate que tiene Hollywood con estos modelos. En ese mismo hilo de HN, jjcm lo resume así:
"ByteDance insiste en texto-a-vídeo para acción y efectos visuales, mientras Hollywood pide vídeo-a-vídeo para preservar interpretaciones." — jjcm, Hacker News
El matiz honesto
Esto no convierte a Extender vídeo en una trampa. Para lo que se le da bien —movimiento continuo, un travelling de cámara, una persecución, un robot corriendo en línea recta— es una mejora real. La alternativa anterior era regenerar el plano entero desde cero cada vez que necesitabas 5 segundos más, perdiendo cara, ropa y luz del personaje por el camino.
pavlov, el mismo usuario que criticaba la falta de control para actuaciones, también reconoce que en secuencias de acción el modelo es "indulgente". Ahí es exactamente donde Extender vídeo brilla: cuando no hay ninguna decisión que tomar dentro del tramo que añades, solo inercia.
A quién le aplica esto
Te sirve si generas b-roll, planos de persecución, cámaras en movimiento continuo o cualquier toma donde el sujeto principal no tiene que decidir nada en el tramo que extiendes — solo seguir haciendo lo que ya hacía. El umbral es simple: si puedes describir el final del clip original con un verbo de continuidad ("sigue corriendo", "la cámara sigue girando"), te va a funcionar.
No te sirve si el momento que quieres capturar es justo el que rompe el vector: un frenazo, un giro de guion, un personaje que se para y reacciona a algo. Ahí el modelo no tiene motivo para inventarse un final distinto al que ya traía — va a seguir corriendo hasta la pared, como Tiangong Ultra.
El caso límite: escribir en el prompt la instrucción de frenar o girar. Mejora el resultado, pero no lo garantiza. Sigue siendo una extrapolación probabilística sobre un vector, no una decisión con lógica de causa y efecto.
Cómo aplicarlo hoy
Prerequisito común: ten el clip completo exportado (no un solo fotograma) y ten claro en qué segundo termina el vector que quieres continuar.
En Jimeng o Doubao (la app de consumo)
Paso 1. Sube el clip entero, no el último fotograma como imagen de referencia. El modelo necesita varios frames para leer velocidad y dirección — con una sola imagen no tiene vector que seguir.
Paso 2. Elige el Task Type Extender vídeo, no "Imagen a vídeo" con el frame final como input. Son dos modos distintos y solo uno lee trayectoria real.
Paso 3. En el campo de duración, escribe los segundos que quieres añadir, no la duración final que buscas. Si tu clip dura 8s y quieres llegar a 13s, pon 5 — no 13.
Paso 4. Describe en el prompt el fotograma límite y la acción nueva, con una palabra de continuidad ("sigue", "continúa"). Si necesitas que algo cambie de dirección, dilo de forma explícita — y no esperes acertar siempre.
Por API (para flujos automatizados)
Si montas esto en un pipeline en lugar de la app de consumo, plataformas como WaveSpeed ya exponen un endpoint video-extend mientras BytePlus ModelArk termina de publicar la API oficial de ByteDance. Los parámetros clave: duration (4 a 30s, por defecto 5s, y es la duración del segmento nuevo, no la total), resolution (480p a 4K) y generate_audio.
Ojo con el pricing:
Cada ronda de extensión relee y factura hasta 30 segundos de contexto anterior, no solo los segundos que añades. Encadenar tres rondas de 5 segundos no te cuesta 15 segundos de cómputo — te cuesta bastante más. Multiplica antes de planear un vídeo largo a base de extensiones sucesivas.
Prueba esto hoy: coge un clip que ya tengas, córtalo justo antes de que pase algo importante en la escena —no después— y extiéndelo 5 segundos. Compara el resultado con cortar justo después del evento. Esa comparación te dice, en dos minutos, si Extender vídeo te sirve para tu flujo o si vas a acabar, como Tiangong Ultra, estampado contra una colchoneta.
Blog oficial: Seedance 2.5 — ByteDance Seed.