Claude no “dibuja” videos, pero se está convirtiendo en el modelo que mejor sabe “escribirlos”. Durante los últimos meses, han aparecido numerosos casos en comunidades de desarrolladores internacionales: basta con entregar una indicación a Claude Code para obtener, diez minutos después, un MP4 con animaciones, voz y subtítulos. Tras el lanzamiento de Claude Opus 5.5 el 22 de septiembre, este tipo de flujo alcanzó un nuevo nivel de calidad. En este artículo veremos cómo Claude Opus 5.5 genera videos mediante código, sus 4 etapas principales y una cadena de herramientas aplicable en la práctica, para entender cómo se consigue.
Valor principal: al terminar este artículo, comprenderás la lógica subyacente de que “el código es el video”, sabrás qué componente se encarga de los recursos SVG, el audio, las animaciones y los subtítulos, y podrás evaluar si tu negocio es adecuado para producir videos por lotes mediante la API de Claude Opus.

Puntos clave de la generación de videos mediante código con Claude Opus 5.5
Primero, aclaremos un malentendido frecuente: Claude Opus 5.5 no es un modelo de generación de videos como Sora o Veo, ni genera píxeles directamente. Lo que hace es escribir el “código fuente del video”, normalmente una página HTML o un conjunto de componentes de React. Después, un motor de renderizado toma capturas fotograma a fotograma en un navegador sin interfaz gráfica y, finalmente, FFmpeg las codifica en un MP4. En otras palabras, el video se convierte en un proyecto frontend que se puede versionar y modificar tantas veces como sea necesario.
Este enfoque ofrece una ventaja difícil de conseguir con los modelos de difusión de IA: el determinismo. El mismo código produce exactamente el mismo resultado sin importar cuántas veces se renderice; el texto no se ve borroso, los iconos no se deforman y el tiempo se controla con precisión de fotograma. Como comentó un creador internacional que utilizó Opus para producir un video promocional, la interfaz mantiene una nitidez a nivel de píxel, la sincronización es precisa y cualquier cambio solo requiere volver a renderizar, no editar todo de nuevo.
| Dimensión | Video generado mediante código (Claude) | Video generado con modelos de difusión (tipo Sora/Veo) |
|---|---|---|
| Forma de producción | Escribe código HTML/React y el navegador renderiza cada fotograma | Genera directamente los fotogramas en píxeles |
| Texto y gráficos | Nitidez a nivel de píxel y precisión del 100 % | Pueden aparecer errores de texto y deformaciones |
| Control | Se puede modificar con precisión de fotograma y basta con volver a renderizar | Los cambios requieren volver a generar el resultado |
| Contenido más adecuado | Animaciones explicativas, demostraciones de productos, visualización de datos y videos cortos con subtítulos | Escenas reales, personas y tomas con estética cinematográfica |
| Costo por ejecución | Tokens del modelo + renderizado local, prácticamente insignificante | Se cobra por segundo y el costo es más elevado |
Por qué Claude Opus 5.5
Escribir un video mediante código es, en esencia, una tarea de agente con una cadena de pasos extensa: redactar el guion, diseñar el storyboard, crear los componentes, coordinar la voz, renderizar, revisar los fotogramas y volver a modificar el resultado. Según la información oficial de Anthropic, Opus 5.5 es el modelo de la serie Opus con mejores capacidades de agente. Cuenta con una ventana de contexto de 1 M y una salida máxima de 128 K. Además, ofrece la mejor comprensión visual de la serie Opus hasta la fecha, ya que puede interpretar capturas de pantalla y gráficos con gran fidelidad. Esto significa que no solo puede escribir el código de las animaciones, sino también entender las imágenes que renderiza, detectar problemas como desbordamientos de texto o superposición de elementos y corregirlos por sí solo.
En cuanto al precio, Opus 5.5 cuesta 4 USD por millón de tokens de entrada y 20 USD por millón de tokens de salida, mientras que las lecturas desde la caché se reducen a 0,20 USD. Según la información oficial, en cargas de trabajo típicas resulta aproximadamente un 40 % más barato que Opus 5. Los proyectos de video suelen requerir la lectura repetida del mismo conjunto de componentes y especificaciones de diseño, por lo que la reducción del precio de la caché resulta especialmente favorable en este tipo de escenarios.
🎯 Sugerencia técnica: si quieres probar primero la capacidad de Opus 5.5 para escribir código de video, puedes invocarlo directamente mediante APIYI apiyi.com con
claude-opus-5-5. La plataforma ya ofrece toda la serie de modelos Claude y es compatible con el formato de API de OpenAI, lo que facilita cambiar de modelo y hacer pruebas rápidas en proyectos existentes.
Las 4 grandes etapas para generar videos con código usando Claude Opus 5.5
Un video completo incluye cuatro capas: recursos visuales, sonido, movimiento y texto. En el enfoque de «el código es el video», Claude puede encargarse de las cuatro mediante código o invocaciones de herramientas, aunque la forma de implementar cada etapa es diferente.

Etapa 1: generar recursos visuales con SVG
Los recursos gráficos son uno de los puntos fuertes de Claude. SVG es texto XML, así que los iconos, diagramas de flujo, ejes de coordenadas, animaciones de logotipos y siluetas de personajes pueden escribirse directamente. Además, se amplían sin perder calidad, por lo que resultan ideales para salidas en 1080p e incluso 4K. En comparación con buscar recursos en bancos de imágenes, los SVG generados por Claude pueden respetar estrictamente los colores y las fuentes de tu marca. Cada elemento tiene su propio id, lo que permite controlar después la animación con precisión, incluso a nivel de una ruta individual.
Para los recursos basados en fotografías reales, Claude «invoca en lugar de generar»: dentro del flujo de trabajo de un agente, puede invocar un modelo de imágenes para generar un fondo o leer una captura de producto que proporciones. Después, puede añadir mediante código efectos Ken Burns de acercamiento y alejamiento, máscaras y anotaciones. HyperFrames incluso ofrece la habilidad /media-use, diseñada específicamente para analizar y coordinar recursos como imágenes, iconos y audio.
Etapa 2: audio y voz en off
Claude no produce audio directamente, pero se encarga de la «orquestación» del audio. Estas son las tres opciones más habituales:
- Voz con TTS: Claude redacta el guion de la narración y llama a servicios de síntesis de voz como ElevenLabs para generar la voz en off, junto con marcas de tiempo por palabra.
- Síntesis de efectos mediante código: sonidos de clic, efectos de transición y avisos pueden sintetizarse directamente con Web Audio API, sin necesidad de archivos de audio.
- Gestión de la música de fondo: incorpora música con licencia al proyecto y utiliza código para controlar el fundido de entrada y salida, la envolvente de volumen y el ducking (reducir automáticamente el volumen de la música cuando aparece la voz).
El proyecto de código abierto claude-explains es un caso representativo. Es compatible con varios motores TTS, como gtts, espeak-ng y supertonic. Claude inserta puntos de activación de voz en el contexto HTML para que la animación se dispare exactamente en el milisegundo en que la narración pronuncia una palabra determinada.
Etapa 3: orquestación de la animación
La animación es la mayor diferencia entre «escribir videos con código» y crear un PPT convencional. En Remotion, cada fotograma es un renderizado de React. Claude utiliza useCurrentFrame() para leer el número del fotograma actual y después calcula la posición, la opacidad y la escala de los elementos mediante spring() e interpolate(). En HyperFrames, Claude puede escribir directamente la línea de tiempo usando GSAP, animaciones CSS, Lottie o Three.js. El framework se encarga de todas las API de temporización del navegador para garantizar que la animación permanezca perfectamente sincronizada durante el renderizado fotograma a fotograma.
Una buena animación no consiste solo en «hacer que algo se mueva»; también debe tener ritmo. Las Agent Skills oficiales de Remotion incluyen 28 archivos de reglas modulares que enseñan al modelo las mejores prácticas sobre parámetros de resortes, entradas escalonadas, transiciones, subtítulos y otros aspectos. Con estas Skills instaladas, Opus 5.5 ya puede producir animaciones muy cercanas al nivel de un diseñador profesional de motion graphics.
Etapa 4: sincronización de subtítulos
Los subtítulos pueden proceder de dos fuentes. La primera es «primero el guion y después el audio»: como Claude ya ha redactado el guion de la narración, TTS devuelve las marcas de tiempo por palabra y Claude genera directamente subtítulos dinámicos con resaltado palabra por palabra. Es el estilo más habitual en las plataformas de videos cortos. La segunda es «primero el audio y después el guion»: para material de voz en off existente, Claude Code puede invocar Whisper para transcribirlo a SRT. Después, realiza una ronda de revisión de nombres de marca y errores tipográficos, y finalmente incrusta los subtítulos en la imagen o exporta el archivo de subtítulos.
| Etapa | Responsabilidad de Claude | Herramientas habituales | Nivel de automatización |
|---|---|---|---|
| Recursos SVG | Escribir directamente gráficos, iconos y diagramas SVG | SVG nativo, invocación de modelos de imágenes | Alto |
| Audio y voz en off | Redactar el guion, invocar TTS y sintetizar efectos mediante código | ElevenLabs, gtts, Web Audio | Medio-alto |
| Orquestación de la animación | Escribir la línea de tiempo, animaciones de resortes y transiciones | Remotion, HyperFrames, GSAP | Alto |
| Sincronización de subtítulos | Generar subtítulos dinámicos a partir de marcas de tiempo y revisarlos | Marcas de tiempo de TTS, Whisper | Alto |
| Renderizado de salida | Invocar el renderizado mediante CLI y realizar comprobaciones mediante capturas de fotogramas | Chrome sin interfaz gráfica, FFmpeg | Alto |
Frameworks principales para generar videos con código usando Claude Opus 5.5
Actualmente, las dos rutas más populares en la comunidad internacional son Remotion y HyperFrames. Ambas están adaptadas específicamente para agentes de IA. Remotion se basa en React, cuenta con un ecosistema maduro y es ideal para equipos frontend; HyperFrames fue publicado como código abierto por HeyGen en 2026 bajo la licencia Apache-2.0. Permite escribir HTML directamente, lo que resulta más amigable para los modelos.

| Criterio | Remotion | HyperFrames |
|---|---|---|
| Forma de desarrollo | Componentes React + TypeScript | HTML puro + atributos temporales como data-start |
| Sistema de animación | spring(), interpolate() |
GSAP, CSS, Lottie, Three.js, entre otros |
| Compatibilidad con agentes | Agent Skills oficiales (28 archivos de reglas) | 21 Skills instalables |
| Inicio rápido | npx create-video + npx remotion skills add |
npx hyperframes init |
| Licencia | Gratis para particulares y equipos pequeños; las empresas grandes necesitan una licencia comercial | Apache-2.0, sin coste de renderizado |
| Usuarios ideales | Equipos que ya utilizan React | Usuarios que buscan ligereza y quieren que el modelo escriba HTML directamente |
El principio central de ambos es prácticamente el mismo: en Chrome sin interfaz gráfica, avanzan la línea de tiempo fotograma a fotograma y toman capturas de pantalla para después entregárselas a FFmpeg, que se encarga de codificarlas. Por eso, con la misma entrada siempre se obtiene el mismo video. Esto permite incorporar los videos al flujo de CI como si fueran código, realizar pruebas de regresión e incluso generarlos por lotes.
Flujo de trabajo típico: de una frase a un MP4
Tomando como ejemplo el método recomendado oficialmente por Remotion, crear un video en Claude Code se divide, a grandes rasgos, en cuatro pasos:
- Inicializar el proyecto: ejecuta
npx create-video --yes --blank my-video, instala después Agent Skills connpx remotion skills adde inicianpm run devpara abrir la vista previa. - Crear primero el storyboard: pídele a Claude que genere una tabla de storyboard por escenas con la imagen, la narración, la duración y las transiciones. Confirmarlo antes de escribir el código reduce considerablemente el retrabajo.
- Desarrollar y revisar automáticamente: Claude escribe los componentes escena por escena. Después de renderizar los fotogramas clave, utiliza sus capacidades visuales para comprobar problemas de desbordamiento de texto, alineación y colores, y los corrige por su cuenta.
- Renderizar e iterar: genera primero un borrador a media resolución y con el desenfoque de movimiento desactivado. Vuelve a renderizar únicamente las escenas modificadas y, cuando el resultado esté aprobado, exporta el MP4 en resolución completa.
Según las pruebas realizadas por creadores internacionales, un video promocional de producto de 10 a 15 segundos puede pasar de la indicación a una primera versión terminada en unos 10 minutos. El renderizado en la nube cuesta apenas unos centavos por ejecución.
🚀 Inicio rápido: si no utilizas Claude Code y quieres integrar este flujo en tu propio servicio backend, te recomendamos invocar Claude Opus 5.5 mediante APIYI apiyi.com. La plataforma ofrece una interfaz unificada: Opus 5.5 puede encargarse de escribir el código y Sonnet 5 de modificarlo por lotes, lo que facilita controlar los costes.
Producción masiva de videos mediante la API de Claude
Claude Code es adecuado para que una persona perfeccione manualmente un video, pero si necesitas generar cada día decenas de presentaciones de productos, informes de datos o animaciones educativas, tendrás que trasladar el flujo a la API. La idea es sencilla: coloca la plantilla de video y las directrices de diseño en la indicación del sistema, y haz que el modelo genere un archivo HTML de HyperFrames a partir de los datos de cada operación. Después, ejecuta el comando de renderizado en el servidor.
Este es un ejemplo mínimo en el que Opus 5.5 genera el código fuente de una animación explicativa de 15 segundos:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://api.apiyi.com/v1" # Interfaz unificada de APIYI
)
resp = client.chat.completions.create(
model="claude-opus-5-5",
messages=[
{"role": "system", "content": "Eres un diseñador de motion graphics. Devuelve un archivo HTML completo de HyperFrames,"
"1920x1080,con fondo oscuro, usando SVG en línea y una línea de tiempo de GSAP,"
"y marca cada elemento con data-start/data-duration. Devuelve solo el código."},
{"role": "user", "content": "Crea una animación de 15 segundos que presente las 4 etapas de la 'generación de videos mediante código', con subtítulos frase por frase."}
],
)
open("index.html", "w").write(resp.choices[0].message.content)
# Después ejecuta: npx hyperframes render
Expandir: flujo completo de producción por lotes con voz en off y subtítulos
import json, subprocess
from openai import OpenAI
client = OpenAI(api_key="YOUR_API_KEY", base_url="https://api.apiyi.com/v1")
def build_video(topic: str, out_dir: str):
# 1. Pide a Claude que genere el guion de voz en off y el storyboard (JSON)
plan = client.chat.completions.create(
model="claude-opus-5-5",
messages=[{"role": "user", "content":
f"Escribe un storyboard para un video de 30 segundos sobre el tema «{topic}» y devuelve JSON: "
'[{"scene":1,"narration":"...","visual":"...","seconds":5}]'}],
).choices[0].message.content
scenes = json.loads(plan)
# 2. Llama al servicio TTS que hayas elegido para generar la voz en off y obtener marcas de tiempo por palabra
# timestamps = my_tts(scenes) # Por ejemplo, la interfaz with-timestamps de ElevenLabs
# 3. Entrega a Claude el storyboard y las marcas de tiempo para generar el HTML de HyperFrames
html = client.chat.completions.create(
model="claude-opus-5-5",
messages=[{"role": "user", "content":
f"Genera un HTML de HyperFrames a partir del storyboard {json.dumps(scenes, ensure_ascii=False)},"
"que incluya recursos SVG en línea, animaciones GSAP, una pista de audio y subtítulos con resaltado palabra por palabra. Devuelve solo el código."}],
).choices[0].message.content
open(f"{out_dir}/index.html", "w").write(html)
# 4. Renderiza el MP4
subprocess.run(["npx", "hyperframes", "render"], cwd=out_dir, check=True)
En la producción por lotes, conviene prestar atención a varios detalles de ingeniería. Primero, coloca las directrices de diseño, la biblioteca de componentes y el código de ejemplo en el prefijo fijo de la indicación. La lectura en caché de Opus 5.5 cuesta solo 0,20 USD por millón de tokens, por lo que el coste de las llamadas repetidas se reduce bastante. Antes de renderizar, ejecuta npx hyperframes lint para validar la sintaxis. Si falla, devuelve el error al modelo para que lo corrija automáticamente. Por último, puedes volver a enviar al modelo capturas de los fotogramas clave renderizados para realizar una revisión visual y crear un ciclo cerrado de «generación → renderizado → revisión → corrección».
| Modelo | Rol recomendado | Ventaja | Plataformas disponibles |
|---|---|---|---|
| Claude Opus 5.5 | Diseño del storyboard, animaciones complejas y revisión visual | Mejores capacidades de agente y comprensión visual | APIYI apiyi.com, API oficial |
| Claude Sonnet 5 | Desarrollo de escenas habituales y modificación de contenidos por lotes | Buena relación calidad-precio y alta velocidad | APIYI apiyi.com, API oficial |
| Claude Haiku 4.5 | Corrección de subtítulos y reescritura de textos | Coste mínimo y baja latencia | APIYI apiyi.com, API oficial |
💰 Optimización de costes: en proyectos reales no es necesario utilizar Opus en todas las etapas. Recomendamos combinar toda la familia de modelos Claude según cada fase mediante APIYI apiyi.com: utiliza Opus 5.5 para el diseño inicial y Sonnet 5 para aplicar la plantilla por lotes. En conjunto, el coste suele reducirse más de la mitad.

Preguntas frecuentes sobre la generación de vídeos mediante código con Claude Opus 5.5
¿Claude Opus 5.5 puede generar directamente vídeos de personas reales?
No. Claude genera código y destaca en animaciones de gráficos, texto, tablas e interfaces. Las personas reales, las escenas reales y las tomas con estilo cinematográfico todavía requieren modelos de vídeo como Sora o Veo. Ambos enfoques pueden combinarse: Claude se encarga de la coordinación y el modelo de vídeo proporciona fragmentos de material grabado.
¿Se puede usar sin saber programar?
Sí. Después de instalar las Skills de Remotion o HyperFrames en Claude Code, todo el proceso se completa prácticamente mediante conversaciones en lenguaje natural. Solo tienes que revisar el storyboard y las vistas previas. Si primero quieres probar el rendimiento del modelo, puedes registrarte en APIYI apiyi.com y utilizar Claude Opus 5.5 directamente en línea con un pequeño saldo para validar los resultados.
¿Cuánto cuesta aproximadamente generar un vídeo?
Tomando como ejemplo una animación explicativa de 30 segundos, una generación completa suele consumir entre decenas y cientos de miles de tokens. Con la tarifa de Opus 5.5 de 4/20 USD, el coste queda entre unos pocos centavos y un dólar, sin contar el coste del TTS. Si el renderizado se realiza localmente, no supone ningún gasto adicional. Se recomienda utilizar APIYI apiyi.com para calcular el coste real por vídeo con una tarea concreta antes de decidir la escala de producción por lotes.
¿Qué hago si las animaciones generadas suelen mostrar texto desbordado o superpuesto?
Haz que el modelo “vea” su propio trabajo. Renderiza algunas capturas de fotogramas clave y envíaselas a Opus 5.5 para que revise los problemas de maquetación y los corrija. Ahí es precisamente donde entra en juego la capacidad visual de Opus 5.5. Además, fijar en la indicación los márgenes de seguridad y un tamaño máximo de fuente puede reducir notablemente este tipo de problemas.
Conclusión: Claude Opus 5.5 lleva el vídeo a la era de lo “programable”
Claude Opus 5.5 convierte la generación de vídeos mediante código, en esencia, en un proceso de ingeniería de software. SVG se encarga de los recursos visuales, el TTS y la síntesis mediante código proporcionan el sonido, Remotion o HyperFrames gestionan la animación y el renderizado, y las marcas de tiempo sincronizan los subtítulos. Claude actúa como director general y conecta todas las etapas. No sustituirá a la grabación real ni a los modelos de difusión, pero en escenarios como las animaciones explicativas, las demostraciones de productos, los informes de datos y los vídeos cortos con subtítulos ya muestra una mayor precisión, controlabilidad y un coste marginal muy bajo.
Para los desarrolladores, el siguiente paso值得关注 es convertir este flujo en una solución basada en API y orientada al procesamiento por lotes: una plantilla, un conjunto de datos y un ciclo de invocaciones de Opus 5.5 permiten producir continuamente vídeos con un estilo uniforme. Te recomendamos integrar la familia completa de modelos de Claude a través de APIYI apiyi.com y empezar validando tu solución de automatización de vídeo con una animación de 15 segundos.
Referencias:
– Introducción a Anthropic Claude Opus 5.5: anthropic.com/claude/opus
– Guía oficial de Remotion para Claude Code: remotion.dev/docs/ai/claude-code
– Repositorio de código abierto de HyperFrames: github.com/heygen-com/hyperframes
– Proyecto de código abierto claude-explains: github.com/noelpuig/claude-explains
– Práctica de Danny Stuart con Opus + Remotion para crear un vídeo promocional: dannystuart.substack.com
Sobre el autor: Equipo técnico de APIYI, especializado en la integración de API de Modelos de Lenguaje Grande y en prácticas de ingeniería. Te invitamos a compartir experiencias sobre la implementación de la generación de vídeos mediante código con Claude a través de APIYI apiyi.com.
