Video To Claude

Envía un video/GIF al modelo de video de Gemini, obtiene un especificación de construcción JSON precisa en fotogramas.

Por rohunvora · rohunvora/video-to-claude

Funciona con configuración ★ 8.8/10

Video To Claude — Envía un video/GIF al modelo de video de Gemini, obtiene un especificación de construcción JSON precisa en fotogramas.

Qué hace

Sube una URL de YouTube, video local, GIF o video de tweet a la API multimodal de Gemini con un prompt ajustado para extraer especificaciones implementables (colores hexadecimales exactos, dimensiones de píxeles, tiempo de animación en ms, easing cubic-bezier, transiciones de estado), luego entrega el JSON estructurado a Claude para construirlo. Se activa cuando un usuario comparte un video/GIF y pide clonar una UI, hacer ingeniería inversa de una demostración de producto o extraer pasos de construcción de tutoriales; un flag --micro agrega una lista de verificación de 'detalles de deleite' para efectos sutiles de microinteracción (dibujos de anillos, brillo, easing de sobreimpulso).

Informe de la prueba

No pude ejecutarlo en vivo (sin GEMINI_API_KEY, google-genai no instalado), pero el repositorio envía salidas previas reales (gallery-specs/*.json) de su propio pipeline --micro — por ejemplo, una especificación de botón de revelación de tarjeta de crédito con colores hexadecimales exactos, una animación de volteo cubic-bezier(0.34,1.56,0.64,1) de 600 ms y el detalle no obvio 'intercambiar texto en la marca de 90 grados para que el usuario nunca lo vea cambiar' — el tipo de precisión a nivel de fotograma que una línea base de solo texto simplemente no puede inventar.

Probado el: 2026-07-16 · Claude Code 2.x (agent harness)

Instalación

git clone https://github.com/rohunvora/video-to-claude ~/.claude/skills/video-to-claude
pip install google-genai
# then set GEMINI_API_KEY in environment (free tier available)

Comandos y prompts de ejemplo

  • /video-to-claudeEnvía un video/GIF al modelo de video de Gemini, obtiene un especificación de construcción JSON precisa en fotogramas.

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Here's a GIF of a button animation, extract the exact hex colors and timing
  • Clone this micro-interaction from the tweet video I just linked
  • Reverse engineer this product demo video into implementable build specs