El Laboratorio de Inteligencia Artificial de Shanghái y otras instituciones han lanzado recientemente IWR-Bench, el primer conjunto de evaluación especializado en medir la capacidad de los grandes modelos de lenguaje para convertir videos en código de páginas web interactivas. Este conjunto tiene como objetivo evaluar de manera más realista las capacidades de los modelos multivía (LVLM) en la reconstrucción de páginas web dinámicas, cubriendo así un vacío en la evaluación de interacciones dinámicas en el campo del desarrollo frontend de IA.
A diferencia de las tareas tradicionales de conversión de imágenes a código (Image-to-Code), IWR-Bench exige que el modelo observe un video que registre el proceso completo de operación del usuario, combinado con todos los recursos estáticos necesarios para la página web, para reconstruir el comportamiento interactivo dinámico de la página. La complejidad de la tarea abarca desde la navegación simple de una página hasta la reconstrucción de reglas complejas de juegos, incluyendo escenarios de aplicación como el juego 2048, la reserva de boletos de avión, entre otros.
Los resultados de las pruebas muestran limitaciones significativas en los modelos de IA en esta tarea. En la evaluación de 28 modelos principales, el mejor rendimiento fue logrado por GPT-5, con una puntuación general de 36,35 puntos, donde la puntuación de corrección de funciones interactivas (IFS) fue del 24,39% y la puntuación de fidelidad visual (VFS) fue del 64,25%. Estos datos reflejan claramente que los modelos tienen mayor fortaleza en la restauración visual, pero presentan una clara debilidad en la implementación de lógica de eventos y funcionalidades interactivas dinámicas.

Desde el punto de vista del método de evaluación, IWR-Bench no solo se enfoca en la capacidad de reproducción visual del modelo, sino que también evalúa automáticamente la corrección de sus funciones interactivas. Cada tarea proporciona recursos estáticos completos, y todos los nombres de archivos están anonimizados, forzando al modelo a asociar los recursos basándose únicamente en coincidencias visuales en lugar de razonamiento semántico. Este diseño se acerca más a los escenarios reales de desarrollo, exigiendo que el modelo comprenda relaciones causales y cambios de estado en el video de operación y luego los convierta en lógica de código ejecutable.
Los investigadores también descubrieron fenómenos interesantes. Las versiones de los modelos que incluyen un "mecanismo de pensamiento" mostraron un mejor desempeño en ciertas tareas, aunque el aumento fue limitado, lo que indica que las capacidades básicas del modelo siguen siendo factores determinantes. Además, los modelos optimizados específicamente para la comprensión de videos no tuvieron un mejor desempeño en esta tarea que los modelos multivía generales, lo que muestra que la tarea de conversión de videos a páginas web difiere esencialmente de las tareas tradicionales de comprensión de videos: no basta con entender el contenido del video, sino que se requiere abstraer los comportamientos dinámicos en lógica de programación.

Desde el punto de vista de los desafíos técnicos, la tarea de conversión de videos a páginas web presenta dificultades en múltiples niveles. En primer lugar, la comprensión temporal, ya que el modelo debe extraer eventos interactivos clave y transiciones de estado a partir de cuadros consecutivos del video. En segundo lugar, la abstracción lógica, que implica convertir los patrones de comportamiento observados en conceptos de programación como escuchadores de eventos y gestión de estados. Tercero, la correspondencia de recursos, que requiere encontrar con precisión archivos como imágenes o estilos dentro de los recursos estáticos anonimizados. Por último, la generación de código, que exige producir código HTML, CSS y JavaScript estructurado y lógicamente correcto.
GPT-5 obtuvo una puntuación general de 36,35 puntos, lo que indica que incluso los modelos multivía más avanzados aún tienen mucho espacio para mejorar en la tarea de convertir comportamientos dinámicos en código ejecutable. El 24,39% de puntuación en la corrección de funciones interactivas significa que más del tres cuartos de las funciones interactivas generadas por el modelo presentan problemas. Esto podría incluir respuestas incorrectas a eventos, errores en la gestión de estados o omisiones en la lógica del negocio.

La introducción de IWR-Bench tiene importantes implicaciones para la investigación y la aplicación de la IA. Desde el punto de vista de la investigación, ofrece una nueva dimensión para evaluar la capacidad de comprensión dinámica y generación de código de los modelos multivía, ayudando a identificar las debilidades tecnológicas actuales. Desde el punto de vista de la aplicación, si la capacidad de conversión de videos a páginas web se desarrolla adecuadamente, podría reducir significativamente la barrera del desarrollo frontend, permitiendo a personas sin formación técnica generar prototipos funcionales simplemente mediante demostraciones de operaciones.
No obstante, es importante tener en cuenta que incluso si un modelo obtiene buenas puntuaciones en este conjunto de evaluación, aún hay una gran distancia hacia la aplicación real. El desarrollo real de páginas web implica múltiples dimensiones como optimización de rendimiento, manejo de compatibilidad, protección de seguridad y mantenibilidad, aspectos que son difíciles de transmitir completamente a través de demostraciones visuales. Además, lógicas de negocio complejas, manejo de casos extremos y detalles de experiencia de usuario también son difíciles de inferir únicamente a partir de videos de operaciones.
Desde la perspectiva de las tendencias industriales, IWR-Bench representa la evolución de la generación de código de IA desde lo estático hacia lo dinámico, desde una sola imagen hacia múltiples imágenes, y desde descripciones hacia demostraciones. Esto contrasta con el enfoque actual de los asistentes de codificación de IA que dependen principalmente de descripciones textuales, proporcionando así una base técnica para herramientas de desarrollo inteligente que ofrezcan una experiencia de "lo que ves es lo que obtienes". Si los modelos logran avances en esta tarea en el futuro, podrían surgir nuevas herramientas de desarrollo de prototipos, permitiendo a los gerentes de productos o diseñadores generar prototipos interactivos de páginas web simplemente grabando videos de operaciones.
Según los resultados de las pruebas, los modelos de IA aún se encuentran en una etapa temprana en la comprensión de interacciones dinámicas complejas. Una fidelidad visual del 64,25% es relativamente alta, lo que indica que los modelos pueden reproducir con bastante precisión la apariencia estática de la página. Sin embargo, la puntuación de corrección de funciones interactivas solo alcanza el 24,39%, lo que demuestra que convertir los comportamientos observados en lógica de programa correcta sigue siendo un gran desafío. Esta brecha refleja la brecha entre "entender" y "hacerlo bien" en la IA: reconocer elementos visuales no equivale a comprender la lógica detrás de las interacciones.
El valor de IWR-Bench no radica solo en proporcionar una herramienta de evaluación, sino también en definir una dirección importante para el desarrollo de capacidades multivía de la IA. Con la difusión de este conjunto de evaluación, se puede esperar que surja más investigación enfocada en la comprensión de comportamientos dinámicos, razonamiento en secuencia y generación de código, impulsando así el valor aplicativo de los grandes modelos multivía en escenarios de desarrollo reales.




