Publicado 2026-09-15 · Actualizado 2026-09-15

Kling 3.0: fórmula de prompts de diálogo y generación por lotes con Kling MCP

Respuesta corta: Kling 3.0 habla cuando escribes el diálogo como [Nombre: quién es, tono]: "línea", colocas esa etiqueta dentro del plano al que pertenece y controlas los huecos con Immediately, y Pause. Da a cada plano un (Duration: N seconds), fija el reparto con Elements, cierra con AUDIO y CONSTRAINTS, y la misma plantilla se puede renderizar cincuenta veces desde Claude Code o Cursor a través de Kling MCP.

La fórmula de diálogo

ParteSintaxisEjemplo
Etiqueta de hablante[Nombre: quién es, tono]:[Mara: barista in a grey apron, tired but warm]:
Líneauna frase entre comillas rectas"We're closed. But the coffee's still hot."
Idioma / acentodentro del corchete, tras el tono[Mara: …, soft Slovak-accented English]:
Palabra de tiempoImmediately, / Pause. antes de la siguiente etiquetaImmediately, [Tomas: …]: "I didn't come for coffee."
Duración del plano(Duration: N seconds) tras la etiqueta del planoShot 2 (Duration: 5 seconds):
Silencioun beat de acción sin etiquetaPause. She sets down the cup; the camera holds.

Cuatro reglas la hacen fiable. Una frase por línea: un clip de 15 segundos lleva tres o cuatro líneas cortas, no un monólogo. La etiqueta va dentro del plano, después de la acción que la motiva, nunca en una lista al final. El tono en el corchete, no en la línea: escribe «(angrily)» como parte de la etiqueta, no entre comillas. Mantén idéntica la descripción de cada hablante en todos los planos; Kling la lee como la misma persona.

Planos, duraciones y el bloqueo del reparto

  • Hasta 15 segundos, hasta seis planos por generación. Etiquétalos Shot 1, Shot 2… y añade (Duration: 5 seconds); las duraciones deben sumar la longitud del clip.
  • Un comportamiento de cámara por plano — estática, push-in, seguimiento, panorámica — y una acción visible. «Se gira, sirve y ríe» son tres beats.
  • Elements: donde la plataforma los ofrezca, sube de dos a cuatro imágenes de referencia por personaje (frontal, perfil, cuerpo entero), nombra el elemento en el prompt y dale un solo trabajo: solo la identidad. Poses, luz y fondo salen del texto del plano.
  • El audio es una frase, no una etiqueta. «Rain on the window, espresso machine hiss, a distant tram; no music»: ambiente, foley y música en una sola frase.

Un ejemplo completo (15 s, tres planos, dos hablantes)

FORMAT: 15 s, 16:9, three shots, one location, natural sound.
ELEMENTS: @Element1 = Mara (identity only: face, hair, build). @Element2 = Tomas (identity only). Clothes, light and poses come from the shots below.
Shot 1 (Duration: 5 seconds): interior, small cafe at closing time, warm tungsten light, chairs already on the tables. Mara wipes the counter and looks up as the door bell rings. Camera: static medium shot from behind the counter.
[Mara: barista in a grey apron, tired but warm, soft Slovak-accented English]: "We're closed. But the coffee's still hot."
Shot 2 (Duration: 5 seconds): Tomas in the doorway, rain on his coat, hesitates, then steps in. Camera: slow push-in from Mara's eye line.
Immediately, [Tomas: mid-thirties, wet coat, out of breath, quiet]: "I didn't come for coffee."
Shot 3 (Duration: 5 seconds): two-shot at the counter. Pause. She sets down a cup anyway and almost smiles; the camera holds on both of them.
[Mara: amused, lower voice]: "Sit down, Tomas."
AUDIO: rain on the window, espresso machine hiss, a distant tram; no music.
CONSTRAINTS: no cuts inside a shot, no extra people, no on-screen text, same clothes and light in all three shots.

Errores habituales

  • Diálogo escrito en prosa («ella dice que está cerrado»): no se renderiza ninguna voz.
  • Tono dentro de las comillas: el modelo puede leerlo en voz alta.
  • Dos hablantes en un mismo corchete: asigna a cada línea su propia etiqueta.
  • Seis planos en 10 segundos: menos de dos segundos por plano no sostienen una línea hablada.
  • Adjetivos distintos para la misma persona en Shot 1 y Shot 3: la cara se desvía.
  • Prompts negativos o tokens de especificación: escribe una línea CONSTRAINTS en su lugar.

Generación por lotes con Kling MCP

Kling publica una guía oficial de MCP: un adaptador de protocolo que permite a un asistente general como Claude o Cursor llamar directamente a texto-a-vídeo, imagen-a-vídeo y generación de imágenes de Kling. Aviso del propio Kling: el uso por MCP y CLI consume solo créditos de pago de tu espacio de trabajo personal; las ventajas del espacio de equipo no se aplican. Servidores comunitarios como mcp-kling envuelven la API pública y añaden sondeo, descarga automática, extensión de 4–5 segundos y sincronía labial; se ejecutan con npx y tus claves de API en variables de entorno. Una entrada típica para Claude Code o Claude Desktop:

{
  "mcpServers": {
    "kling": {
      "command": "npx",
      "args": ["-y", "mcp-kling@latest"],
      "env": {
        "KLING_ACCESS_KEY": "<from your Kling API console>",
        "KLING_SECRET_KEY": "<from your Kling API console>"
      }
    }
  }
}

Nunca pegues claves en un prompt ni en un archivo compartido; guárdalas en el bloque env de la configuración o en tu shell. Después describe el lote al agente una sola vez:

Read scenes.json (an array of {id, prompt, duration, aspect}).
For each scene, in order:
1. Validate the prompt: it must contain FORMAT, at least one "Shot N (Duration:" label, at least one "[Name: ...]:" dialogue label and a CONSTRAINTS line. Skip and report any scene that fails.
2. Call the Kling text-to-video tool with model kling-v3-omni, the scene's duration and aspect ratio, and the prompt verbatim.
3. Poll until the job is ready, download the file as out/<id>.mp4.
4. Append {id, task_id, file, seconds, status} to out/manifest.json.
Run scene 001 first and stop for my confirmation before the rest.

Tres hábitos mantienen a raya la factura de créditos: validar antes de renderizar (el agente comprueba los bloques obligatorios de cada escena), lanzar primero una escena y confirmar la voz y el corte, y escribir un manifiesto para poder repetir a solas un trabajo fallido. Los modelos Omni (kling-v3-omni) aceptan el mismo prompt para texto-a-vídeo e imagen-a-vídeo, así que un lote puede mezclar ambos.

Dónde encaja GoldenPrompts

El atelier Trends escribe cada escena con esta sintaxis — FORMAT, bloqueo del reparto, planos numerados con duraciones, etiquetas de diálogo con tono, AUDIO y CONSTRAINTS — y el atelier Canvas mantiene coherentes los fotogramas de entrada y salida entre escenas. Exporta las escenas, guárdalas como scenes.json y el prompt de lote de arriba renderiza todo el storyboard. La alternativa de toma única está en la guía de prompts de Seedance 2.5; el panorama de modelos, en generadores de vídeo IA 2026.

Preguntas frecuentes

¿Cuál es la sintaxis de diálogo de Kling 3.0?

Una etiqueta de hablante entre corchetes seguida de la línea entre comillas rectas: [Mara: barista in a grey apron, tired but warm]: "We're closed. But the coffee's still hot." El corchete lleva quién es la persona, el tono y, si hace falta, el idioma o el acento. Kling renderiza la voz, la sincronía labial y el tiempo a partir de esa única línea.

¿Cómo controlo cuándo se dice una línea?

Con palabras de tiempo antes de la siguiente etiqueta. «Immediately, [Tomas: …]: "…"» reproduce la respuesta sin hueco; «Pause.» antes de una acción o una etiqueta inserta un beat sostenido. Coloca la etiqueta dentro del plano al que pertenece la línea y mantenla en una frase: con 15 segundos en total tienes sitio para tres o cuatro líneas cortas.

¿Cuánto puede durar un clip de Kling 3.0 y cuántos planos admite?

Hasta 15 segundos por salida con hasta seis planos en una sola generación. Etiquétalos Shot 1, Shot 2 … y da a cada uno una duración entre paréntesis — Shot 2 (Duration: 5 seconds): — para que el corte caiga donde lo planeaste. Escenas más largas: extiende el clip 4–5 segundos por ronda o encadena salidas.

¿Cómo mantengo el mismo personaje entre planos?

Define el personaje una vez al principio con las mismas palabras que reutilizas en cada plano y, donde la plataforma admita Elements, sube de dos a cuatro imágenes de referencia por personaje (retrato frontal, perfil, cuerpo entero). Nombra el elemento en el prompt y dale un solo trabajo — solo la identidad — para que la pose, la luz y el fondo salgan de la descripción del plano, no de la foto.

¿Qué es Kling MCP?

Kling publica una guía oficial de MCP (Model Context Protocol): un adaptador de protocolo que permite a asistentes generales como Claude o Cursor llamar directamente a texto-a-vídeo, imagen-a-vídeo y generación de imágenes de Kling desde un chat o una sesión de código. Kling advierte que el uso por MCP y CLI solo consume créditos de pago de tu espacio de trabajo personal; las ventajas del espacio de equipo no se aplican. Servidores comunitarios como mcp-kling envuelven la API pública y añaden sondeo, descarga automática, extensión y sincronía labial.

¿La generación por lotes cambia cómo escribo el prompt?

No: hace obligatoria la estructura. Cada escena del lote necesita los mismos bloques (FORMAT, ELEMENTS, Shot 1…n con duraciones, etiquetas de diálogo, AUDIO, CONSTRAINTS) para que el agente los valide antes de gastar créditos. Prueba una escena, corrige la plantilla y luego lanza la lista. El atelier Trends de GoldenPrompts escribe las escenas exactamente en esta sintaxis, así que la lista está lista para pegar.


¿Quieres las escenas escritas en sintaxis Kling, listas para el lote? GoldenPrompts las construye — planos, duraciones, etiquetas de diálogo, bloqueo del reparto, audio y restricciones — en unos pocos clics. Pruébalo — 24 horas de todo gratis, sin tarjeta.