Dos selfies, una foto de tu calle y tus imágenes de memes: un vlog de 30 segundos en una sola toma donde los memes toman café en una terraza y cruzan el semáforo detrás de ti. El workflow completo se ve aquí sin cuenta.
Demo interactiva
Workflow real, resultados reales. Muévete y haz zoom libremente.
El workflow está ahí: la ficha de personaje, la foto de la calle, seis fichas de memes para reemplazar por tus imágenes, las dos consignas y el vídeo Wan 3.0 con el sonido de la calle. Muévete, haz zoom, abre los nodos.
En resumen
Lo que produce el workflow
1 vídeo de 30 s en 720p, formato 9:16
Estructura del canvas
12 nodes conectados por 3 enlaces
Modelos conectados
Wan 3.0
Coste de una pasada completa
unos 360 créditos, es decir 4,32 US$
El formato arrasa en TikTok y Reels: un vloguero camina por su calle filmándose con la cámara frontal, y unos memes viven su vida en el decorado detrás de él, sentados en la terraza del café, comprando un libro, esperando en el paso de peatones. Nadie reacciona, y esa flema es lo que hace el vídeo. Treinta segundos, una sola toma, sin rodaje, sin montaje, sin extras.
Lo que sostiene el formato no son los memes, es la disciplina del plano: una ficha de personaje multiángulo que fija tu cara y tu ropa del primer al último plano (la guía mantener un personaje coherente explica por qué), una cámara frontal que nunca se gira, un solo meme por escena y una frase declarada palabra por palabra. El template lleva todas estas reglas en sus consignas: tú solo reemplazas las imágenes.
En cuanto a modelos, Wan 3.0 es el único del catálogo que aguanta treinta segundos en plano único con diez imágenes de referencia, el audio generado en el vídeo y, sobre todo, una cara real aceptada como referencia. Seedream 5 Pro fabrica la ficha de personaje a partir de dos o tres selfies, y la calculadora pública da el coste exacto antes de cualquier registro.
Cómo hacerlo
1
Genera tu ficha de personaje
Dos o tres selfies en un nodo Imagen con Seedream 5 Pro: cuerpo entero de frente, tres cuartos, perfil y espalda, más primeros planos de la cara, fondo neutro, la misma ropa en todo. Esa plancha es la que sostiene tu cara durante los treinta segundos.
2
Fotografía tu calle
Una sola foto, con profundidad: acera ancha, comercios a ambos lados, si puede ser una terraza o un escaparate. Dos fotos del mismo sitio harían inventar una calle que no existe.
3
Importa TUS memes
Una imagen por ficha, el personaje bien grande en el encuadre, sin texto por encima. Los dibujos y los animales funcionan muy bien; las fotos de personas reales suelen ser rechazadas por los proveedores, y nunca fotos de niños.
4
Ajusta la frase de apertura
El vloguero solo habla una vez, al principio, y la frase está declarada palabra por palabra en la consigna: eso es lo que impide que el modelo invente diálogos. Usa palabras corrientes, las palabras raras salen mal pronunciadas.
5
Genera en 9:16 con sonido
Treinta segundos, vertical, audio activado: el ambiente de calle, los pasos y la frase se generan con la imagen. El formato se publica tal cual, sin montaje.
Variantes y casos de uso
El mismo canvas, ajustado a necesidades distintas: cada variante son dos o tres líneas de prompt que cambiar.
Vídeo meme para TikTok y Reels
El formato nativo del feed: 9:16 vertical, treinta segundos en una sola toma, sonido de calle generado con la imagen. No hay cortes que esconder ni montaje que hacer, el vídeo se publica tal cual, y el plano secuencia retiene más que una sucesión de planos: se espera el siguiente meme como un gag recurrente.
Ponerte en escena con tus propios memes
La ficha de personaje se genera desde dos o tres selfies: tu cara y tu ropa se mantienen idénticas durante toda la toma, sin rodaje. El mismo principio que el workflow ponerse en escena, llevado al plano secuencia: eres tú quien camina por la calle, no un doble aproximado.
Un personaje cartoon en la vida real
La mezcla de animación e imagen real, al estilo de las películas híbridas: el dibujo conserva sus colores planos y sus contornos de tinta, pero proyecta una sombra de verdad sobre la acera y se cruza con transeúntes reales. La consigna del template blinda ese contrato: un personaje dibujado sigue dibujado del primer al último plano, jamás reemplazado por un actor.
Vlog IA sin cámara ni rodaje
Todo el plató es generado: la calle sale de una foto de referencia, la luz de hora dorada, la multitud y el sonido de la calle se fabrican con la imagen. El resultado conserva los defectos que dan realismo, microtemblores, autofoco que duda, balance de blancos que se corrige, la gramática del vlog amateur descrita en escribir un prompt que funciona.
La mascota de marca en la calle
Reemplaza los memes por tu mascota: toma un café en la terraza, espera el autobús, sale de tu tienda con una bolsa. La misma mecánica, con uso profesional: la mascota vive en el mundo real de tus clientes, y la ficha de referencia garantiza que siga idéntica de un vídeo a otro.
Errores frecuentes
El teléfono se gira a la cámara trasera
No pidas nunca al vloguero que gire la cámara: el modelo no sabe representar el gesto y lo resuelve filmándolo de espaldas, algo imposible con el teléfono en su propia mano. Es el cuerpo el que pivota para mostrar la escena detrás del hombro, la cámara sigue frontal de principio a fin.
Dos memes en la misma escena se fusionan
Dos personajes que comparten un bloque de cinco segundos intercambian sus atributos o se funden en uno solo. Un meme por escena, esa es la regla más importante de la estructura: el único momento con varios es el final, donde los personajes ya aparecidos se ponen en fila.
Aparecen bocadillos y rótulos raros
Cualquier nombre o texto presente en la consigna puede acabar escrito en la imagen, como bocadillo de cómic o rótulo de tienda. Describe la pose y la actitud del meme, nunca su nombre, y mantén la regla de texto del template: ninguna escritura inventada, rótulos realistas e ilegibles.
El vídeo arranca congelado en la ficha de personaje
Si la ficha entra como primera imagen en lugar de referencia, el clip se abre sobre la propia plancha multiángulo. Las imágenes de este template son todas referencias de identidad: guían el resultado sin servir nunca de primer fotograma.
Las fichas aceptan cualquier imagen importada: el template trae ejemplos inventados, y eres tú quien elige tus imágenes. Ten en cuenta que los memes célebres son obras protegidas y que muchos muestran a personas reales, que los proveedores suelen rechazar como referencia: los dibujos y los animales son los que mejor funcionan.
¿Por qué mi cara pasa aquí y la rechazan en otros sitios?
Algunos modelos de vídeo rechazan cualquier cara real como imagen de referencia, es una política del proveedor. Wan 3.0 las acepta: es una de las razones por las que el template funciona sobre él, junto con sus treinta segundos en plano único.
¿La voz del vloguero es la mía?
No, la frase la interpreta el modelo con una voz generada que encaja con el personaje. Para oír tu voz real, conecta una muestra de audio como voz de referencia en el nodo Vídeo: Wan 3.0 acepta hasta cinco.
¿Cuánto cuesta un vídeo meme de 30 segundos?
El precio depende del modelo y de la resolución elegidos: la calculadora pública muestra el coste exacto del workflow antes de cualquier registro, y el presupuesto se actualiza en el nodo Vídeo con cada ajuste. Los treinta segundos de Wan 3.0 en 720p siguen entre los planos largos más asequibles del catálogo.
¿Hay que filmarse a uno mismo?
No: la ficha de personaje generada desde tus selfies basta, el vloguero y su caminata los crea el modelo. Si quieres tu forma real de andar y tu calle real, Wan 3.0 también acepta un vídeo como referencia: fílmate en selfie y el modelo lo usa como guía de movimiento.
¿Cuántos memes caben en un vídeo?
La estructura del template cuenta seis escenas de cinco segundos, un meme por escena. Para mostrar más, genera un segundo clip con la misma ficha de personaje y la misma foto de calle, y luego une los dos en el montaje: las referencias compartidas mantienen la cara y el decorado idénticos.
¿En qué idioma habla el vloguero?
En el de la frase que escribas en la consigna: se interpreta palabra por palabra, y el ambiente sonoro sigue el idioma pedido. Usa palabras corrientes y una frase corta, es lo que suena más natural al oído.