De texto a vídeo en Telegram

Genera vídeo a partir de un prompt de texto dentro de un chat de Telegram. Cinco modelos, de 480p a 4K, duraciones desde 2 segundos, con precio por segundo y sin suscripción.

El texto a vídeo es el arranque en frío: sin foto, sin referencia, solo una descripción escrita que entra y un clip que sale. Todos los modelos del bot lo aceptan, y la diferencia entre un resultado aprovechable y uno turbio está sobre todo en cómo se escribe el prompt.

Escribe para una cámara, no para un buscador

La costumbre que la gente trae de las herramientas de imagen es amontonar adjetivos. El vídeo premia otra cosa: di qué hay en el plano y luego di qué está haciendo el plano. Un sujeto, un entorno, una posición de cámara y un movimiento llevan un clip mucho más lejos que una lista de palabras de estilo.

Un prompt como «slow push in on a woman reading by a rain-streaked window, warm lamplight, quiet evening» le da al modelo cuatro cosas sobre las que actuar. «Beautiful cinematic masterpiece 8k detailed» no le da ninguna.

Di qué se mueve

El vídeo tiene un eje que las imágenes no tienen, y es justo el que se olvida escribir. Si en el prompt no se mueve nada, el modelo se inventa el movimiento, y el movimiento inventado es donde los clips empiezan a verse raros. Nombra el movimiento que quieres, ya sea del sujeto, de la cámara o de la luz.

Prueba barato y luego apuesta

Prueba la redacción en el modelo de entrada a 480p. Un borrador de seis segundos son 12 créditos, así que puedes probar tres redacciones por menos de lo que cuesta un clip terminado. Cuando la redacción produzca el plano que tenías en la cabeza, relánzala en una resolución mayor y en un modelo más pesado. Abre el bot y el selector de modelo queda a un toque del borrador. La guía paso a paso cubre el resto del recorrido.

Elegir modelo para un prompt escrito

El nivel cinematográfico es al que acudir cuando el plano necesita un movimiento de cámara o tiene que cortar entre ángulos. El nivel de calidad aguanta mejor el detalle fino y es la elección cuando el sujeto tiene que resistir una mirada de cerca. El modelo de entrada no es solo más barato: siempre devuelve sonido, lo que hace que un clip hecho solo con texto se sienta terminado sin un segundo paso. Los cinco aceptan un prompt escrito, y la página de precios dice cuánto cuesta cada segundo.

Y si ya tienes la imagen y lo que quieres es que se mueva, eso es de imagen a vídeo.

Preguntas frecuentes

¿Puedo hacer un vídeo solo con texto?

Sí. Todos los modelos del catálogo aceptan un prompt escrito sin imagen adjunta, y tres de ellos tratan el texto como entrada principal.

¿Cuánto debería ocupar un prompt?

Unas pocas frases ganan a un párrafo. Nombra el sujeto, el entorno, la cámara y el ambiente, y para ahí. Los prompts largos tienden a diluir en lugar de afinar.

¿Qué modelo maneja mejor los prompts de texto?

El nivel cinematográfico si el plano necesita movimiento de cámara, y el nivel de calidad si el detalle importa más que el movimiento. El modelo de entrada es donde probar primero la redacción, porque es barato.

¿Tengo que describir la cámara?

No es obligatorio, pero ayuda. Nombrar un tipo de plano y un movimiento le da al modelo algo concreto, y es la forma más sencilla de que un clip parezca filmado y no generado.

¿Cuánto cuesta un clip de texto a vídeo?

La tarifa del modelo y la resolución que elegiste, por el número de segundos. En el modelo de entrada son dos créditos por segundo a 480p.

zosee video es un producto independiente. No está afiliado, respaldado ni patrocinado por Telegram, xAI, Alibaba, Kuaishou, Google, OpenAI ni Runway. Los nombres de los modelos son marcas registradas de sus respectivos propietarios.

Crea un clip en Telegram

Únete al canal de ideas y reclama una bonificación única del tamaño exacto de un clip corto en el modelo de entrada. Los créditos no caducan.