AI erases the boundary between design and programmingLa IA borra la frontera entre diseñar y programar · V8.1 Master Engine
44 slides · 34 min · 13 hours ago44 láminas · 34 min · hace 13 hlanguage
ENES
theme
LightDark
view
TalkTable
brand
HanademiPlatzi
Daily AI use has already reached 51% among professional developers, but 46% distrust its accuracy.
In 2026, 95.9% of one million pages still had WCAG issues detectable automatically.
Sustainable results depend on measuring quality, security, accessibility, and cost, not just output.
El uso diario de IA ya alcanza 51% entre desarrolladores profesionales, pero 46% desconfía de su precisión.
En 2026, 95,9% de un millón de páginas todavía tenía fallas WCAG detectables automáticamente.
El resultado sostenible depende de medir calidad, seguridad, accesibilidad y costo, no solo producción.
AI is no longer an occasional experiment: 51% of professional developers use it daily. But trust has not kept pace. 46% distrust its accuracy, while only 3% trust it a great deal.
La IA dejó de ser una prueba ocasional: 51% de los desarrolladores profesionales la usa a diario. Pero la confianza no acompaña ese ritmo. Un 46% desconfía de su precisión, mientras solo 3% confía mucho.
Daily adoption is high, but that does not mean everyone is on board. 47.1% use AI tools every day, while 16.2% do not use them and do not plan to. Among developers, distrust remains higher than trust.
La adopción diaria es alta, pero no significa que todos estén dentro. El 47,1% usa herramientas de IA cada día y 16,2% no las usa ni planea hacerlo. Entre desarrolladores, la desconfianza sigue siendo mayor que la confianza.
Agents do appear to speed up individual work. 69% of their users say their productivity increased. But only 17% perceive improved collaboration, a sign that team integration is a separate challenge.
Los agentes sí parecen acelerar el trabajo individual. El 69% de sus usuarios dice que aumentaron su productividad. Pero solo 17% percibe una mejora en la colaboración, una señal de que la integración del equipo es otro problema.
The promise of speed runs into a very human problem: the result looks finished, but still fails. 66% identify almost-correct responses as a frustration. For 45%, debugging generated code takes longer.
La promesa de velocidad tropieza con un problema muy humano: el resultado parece terminado, pero todavía falla. El 66% señala las respuestas casi correctas como frustración. Para 45%, la depuración del código generado tarda más.
Generative AI is no longer just a feature within a tool. More than 1.1 million public GitHub repositories use an LLM SDK. Nearly 694,000 of them appeared in the previous 12 months, signaling infrastructure taking shape at remarkable speed.
La IA generativa ya no es solo una función dentro de una herramienta. Más de 1,1 millones de repositorios públicos de GitHub usan un SDK de LLM. Casi 694.000 de ellos aparecieron en los 12 meses anteriores, una señal de infraestructura que se está formando a gran velocidad.
Scale matters because it changes the size of the problem teams must govern. GitHub recorded 986 million commits in 2025. At the same time, more than more than 230 new repositories were created per minute, a continuous stream of software requiring review and control.
La escala importa porque cambia el tamaño del problema que deben gobernar los equipos. GitHub registró 986 millones de commits en 2025. Al mismo tiempo, se crearon más de 230 repositorios nuevos por minuto, una corriente continua de software que exige revisión y control.
Design no longer lives within a single role. 64% of product creators identify with two or more roles. In addition, 56% of non-designers are heavily involved in design tasks. The boundary between deciding, designing, and prototyping is becoming part of product work.
El diseño ya no vive dentro de un único cargo. El 64% de los creadores de producto se identifica con dos o más roles. Además, 56% de las personas no diseñadoras participa mucho en tareas de diseño. La frontera entre decidir, diseñar y prototipar se está volviendo parte del trabajo de producto.
Dylan Field onstage gives a human face to the convergence of design and development.
Dylan Field en el escenario pone un rostro humano a la convergencia entre diseño y desarrollo.
The strongest signal is not simply that people work faster. 91% say AI tools improve their designs, and 80% say they collaborate better. The expansion also appears in the scope of work: more tasks, more high-value work, and no decline in design's importance in AI-powered products.
La señal más fuerte no es solo que la gente trabaje más rápido. El 91% dice que las herramientas de IA mejora sus diseños y 80% dice que colabora mejor. La expansión también aparece en el alcance del trabajo: más tareas, más trabajo de alto valor y una importancia del diseño que no disminuye en productos con IA.
Convergence does not automatically eliminate complexity. 72% attribute role changes to AI, and 71% say they use more tools. Teams manage 7.6 categories on average, while a project may pass through five stages across different platforms. More capability can mean more context to coordinate.
La convergencia no elimina automáticamente la complejidad. El 72% atribuye el cambio de rol a la IA y 71% dice usar más herramientas. Los equipos manejan 7,6 categorías en promedio, mientras un proyecto puede pasar por cinco etapas en plataformas distintas. Más capacidad puede significar más contexto que coordinar.
The gap does not appear only when someone writes code. 52% of developers cite different assumptions, and 49% cite different priorities. From the other side, 90% of designers say the final product does not match the design. The first benefit of convergence will be making handoff executable.
La brecha no aparece solo cuando alguien escribe código. El 52% de los desarrolladores habla de supuestos distintos y el 49% de prioridades distintas. Desde el otro lado, 90% de los diseñadores dice que el producto final no coincide con el diseño. La primera ganancia de la convergencia será hacer ejecutable el traspaso.
A shared review of code shows how handoff can become direct, cross-role problem solving.
Una revisión conjunta del código muestra cómo el traspaso puede convertirse en resolución directa entre roles.
Frequent collaboration does not guarantee smooth collaboration. 84% of designers say they collaborate weekly, but only 63% consider it effective. The distance becomes more visible in the Telerik comparison: 36% of engineers, versus just 10% of designers, say there are no difficulties.
La colaboración frecuente no garantiza una colaboración fluida. El 84% de los diseñadores dice colaborar semanalmente, pero solo 63% la considera efectiva. La distancia se vuelve más visible en la comparación de Telerik: 36% de los ingenieros, frente a apenas 10% de los diseñadores, dice que no hay dificultades.
Designers and engineers are close on broad effectiveness but far apart on whether collaboration is truly frictionless, exposing what average satisfaction conceals.
Diseñadores e ingenieros están cerca en eficacia general pero muy separados sobre si la colaboración realmente carece de fricción, lo que revela aquello que oculta la satisfacción promedio.
AI can produce a page that people prefer visually. In 64% of cases, evaluators considered the generated page better, and in 49% they considered it capable of replacing the original. But the study measures appearance and visual content. A correct experience also requires functionality, accessibility, security, and maintenance.
La IA puede producir una página que las personas prefieren visualmente. En 64% de los casos, los evaluadores consideraron mejor la página generada, y en 49% la consideraron capaz de reemplazar la original. Pero el estudio mide apariencia y contenido visual. Una experiencia correcta también exige funcionalidad, accesibilidad, seguridad y mantenimiento.
A developer inspecting HTML and CSS makes the implementation layer of interface quality visible.
Una persona desarrolladora que inspecciona HTML y CSS hace visible la capa de implementación de la calidad.
Figma is no longer a tool reserved for designers. In the fourth quarter of 2024, approximately 30% of its monthly active users were developers. At the same time, approximately 67% were outside traditional design roles. The platform now functions as a shared space for design and development.
Figma dejó de ser una herramienta reservada a los diseñadores. En el cuarto trimestre de 2024, cerca de 30% de sus usuarios activos mensuales eran desarrolladores. Al mismo tiempo, aproximadamente 67% estaba fuera de los roles tradicionales de diseño. La plataforma ya funciona como un espacio compartido entre diseño y desarrollo.
Faster interface production did not automatically improve accessibility. Between 2025 and 2026, the share of pages with detectable failures rose from 94.8% to 95.9%. The average also increased, from 51 to 56.1 errors per page. These results indicate a regression in automated detections, although they do not replace a full audit.
La producción acelerada de interfaces no se tradujo en una mejora automática de accesibilidad. Entre 2025 y 2026, la proporción de páginas con fallas detectables subió de 94,8% a 95,9%. El promedio también aumentó, de 51 a 56,1 errores por página. Estos resultados señalan una regresión en las detecciones automáticas, aunque no sustituyen una auditoría completa.
Accessibility does not fail for a single reason. Low contrast appears on 79.1% of pages, followed by alternative-text and labeling problems. Even at the element level, 1 in every 24 has a detectable error. Fast production needs controls that check complete patterns, not just the overall appearance.
La accesibilidad no falla por una sola causa. El contraste bajo aparece en 79,1% de las páginas, seguido por problemas de texto alternativo y etiquetas. Incluso cuando miramos cada elemento, 1 de cada 24 tiene un error detectable. La velocidad de producción necesita controles que revisen patrones completos, no solo la apariencia general.
Asking a tool for accessibility did not guarantee a more accessible interface in this study. Average severity reached 0.54 with accessibility-oriented prompts, versus 0.39 with neutral prompts. The sample was small, with 50 interfaces and 5 tools. The practical takeaway is that the initial prompt needs dialogue, review, and testing.
Pedir accesibilidad a una herramienta no garantizó una interfaz más accesible en este estudio. La severidad promedio llegó a 0,54 con indicaciones orientadas a accesibilidad, frente a 0,39 con indicaciones neutrales. La muestra fue pequeña, con 50 interfaces y 5 herramientas. El mensaje práctico es que la indicación inicial necesita diálogo, revisión y pruebas.
Declarar la intención de accesibilidad no bastó: la gravedad subió de 0,39 a 0,54, mientras el refinamiento iterativo mejoró los resultados en tres de cinco herramientas.
Coding agents resolved a much higher proportion of issues on SWE-bench Verified. The result rose from 33.2% in 2024 to 65% in 2025 and 76.8% in February 2026. This is a strong signal of progress on this benchmark. But the 16% reference comes from the original benchmark, so the comparison requires care.
Los agentes de programación resolvieron una proporción mucho mayor de incidencias en SWE-bench Verified. El resultado pasó de 33,2% en 2024 a 65% en 2025 y 76,8% en febrero de 2026. Es una señal fuerte de progreso en este benchmark. Pero la referencia de 16% pertenece al benchmark original, así que la comparación exige cuidado.
The performance jump matters, but so does the size of the playing field. SWE-bench Verified uses 500 cases, while the original benchmark has 2,294. In addition, those original cases come from just 12 Python repositories. The result measures a real capability in a specific environment, not all enterprise backend work.
El salto de rendimiento importa, pero el tamaño del campo de juego también. SWE-bench Verified usa 500 casos, mientras el benchmark original tiene 2.294. Además, esos casos originales proceden de solo 12 repositorios Python. El resultado mide una capacidad real dentro de un entorno concreto, no todo el trabajo de backend empresarial.
AI wins on a very specific front here. In the experiment with 95 professionals, Copilot cut completion time by 55%. It also raised the completion rate from 70% to 78%. The lesson is powerful but limited: a well-defined task can be accelerated without proving that all expert work will be faster.
Aquí la IA gana en un terreno muy concreto. En el experimento con 95 profesionales, Copilot redujo el tiempo en 55%. También llevó la finalización de 70% a 78%. La lección es potente, pero acotada: una tarea delimitada puede acelerarse sin demostrar que todo el trabajo experto será más rápido.
This is the other half of the story. On real-world tasks in their own repositories, expert developers took 19% longer with AI, even though they expected to be 24% faster. They later reported feeling 20% faster, but that perception did not match the measured time. The 2026 follow-up pointed to an 18% slowdown, although its own methodological warning means it should be treated as a weak signal.
Esta es la otra mitad de la historia. En tareas reales sobre sus propios repositorios, desarrolladores expertos tardaron 19% más con IA, aunque esperaban ser 24% más rápidos. Después reportaron una sensación de mejora de 20%, pero esa percepción no coincide con el tiempo medido. El seguimiento de 2026 apunta a 18% de desaceleración, aunque su propia advertencia metodológica obliga a tratarlo como una señal débil.
Generation speed does not eliminate the security problem. GPT-5 Mini achieved a 72% pass rate, and GPT-5 reached 70%. Both exceeded the 50% to 59% range for other new models, but still failed a significant share of the 80 tasks. The message for design and development is direct: an interface that works can conceal code that needs review.
La velocidad de generación no elimina el problema de seguridad. GPT-5 Mini alcanzó una tasa de aprobación de 72% y GPT-5 llegó a 70%. Ambos superaron la banda de 50% a 59% de otros modelos nuevos, pero todavía fallaron en una parte relevante de las 80 tareas. El mensaje para diseño y desarrollo es directo: una interfaz que funciona puede esconder código que necesita revisión.
Una alta proporción sin vulnerabilidades y un récord de aprobación en el benchmark coexisten con incidencias en más del 15 % de los commits de cada asistente estudiado.
AI-generated code can look clean at first glance. In 7,703 files, 87.9% had no identifiable CWE vulnerability. But the analysis found 4,241 instances across 77 types, and AI also generated documentation in 39% of the files. The lesson is simple: working output still requires security review and maintenance.
El código generado por IA puede parecer limpio a primera vista. En 7.703 archivos, el 87,9% no tenía una vulnerabilidad CWE identificable. Pero el análisis encontró 4.241 instancias en 77 tipos, y la IA también generó documentación en el 39% de los archivos. La lección es simple: una salida que funciona todavía necesita revisión de seguridad y mantenimiento.
Code reflected at eye level turns residual risk into a visible review responsibility.
El código reflejado a la altura de los ojos convierte el riesgo residual en una responsabilidad visible de revisión.
The labor-market signal is not a simple disappearance. Developers retain uneven optimism about AI, while U.S. projections remain positive for software and digital design. But entry into the sector is already shifting: 55% of computer science graduates had their first job outside software in 2024, compared with 49% in 2016.
La señal laboral no es una desaparición simple. Los desarrolladores mantienen un optimismo desigual ante la IA, mientras las proyecciones estadounidenses siguen siendo positivas para software y diseño digital. Pero la entrada al sector ya se mueve: 55% de los graduados en informática tuvo su primer empleo fuera del software en 2024, frente a 49% en 2016.
The occupations closest to design-code convergence are projected to outgrow the labor market, pointing to skill transformation rather than immediate occupational disappearance.
Se proyecta que las ocupaciones más cercanas a la convergencia entre diseño y código superen al mercado laboral, lo que apunta a una transformación de habilidades y no a una desaparición ocupacional inmediata.
The platform is not just growing in sales. Its quarterly revenue rose from 156 to 370 million USD, while research and development spending increased from 164.8 million to 1,029.7 million USD. The commercial signal is also strong: net revenue retention reached 136% as customers expanded their seats and AI credits.
La plataforma no solo está creciendo en ventas. Sus ingresos trimestrales pasaron de 156 a 370 millones de USD, mientras el gasto en investigación y desarrollo subió de 164,8 millones a 1.029,7 millones de USD. La señal comercial también es fuerte: la retención neta de ingresos llegó al 136%, porque los clientes ampliaron puestos y créditos de IA.
Un estudio en producción encontró que el código C++ generado por IA aumentó entre 5% y 8% el consumo de recursos computacionales en 3,52 millones de cambios.
AI now spans design, frontend, and backend, but speed does not guarantee quality. The advantage will go to those who can turn ideas into verifiable software without sacrificing accessibility, security, context, or human judgment.
Key findings
In 2025, 16 expert developers completed 246 tasks 19% more slowly with AI, although they expected to be 24% faster. Model Evaluation and Threat Research
METR's randomized trial found experienced open-source developers took 19% longer when using early-2025 AI tools. metr.org
In 2025, 94.8% of the million pages analyzed by WebAIM had automatically detectable WCAG failures. WebAIM
On SWE-bench Verified, comparable performance rose from 33.2% in 2024 to 65% in 2025 and 76.8% in February 2026. OpenAI
In an experiment with 95 professionals, Copilot reduced time by 55% and increased completion from 70% to 78%. GitHub
In 2025, the most common failures affected contrast, 79.1%; alternative text, 55.5%; labels, 48.2%; empty links, 45.4%; empty buttons, 29.6%; and language, 15.8%. WebAIM
UX Tools' Design Delivery Survey found 90% of designers report mismatched final products, 80% missed design changes, and 55% incorrect design-system elements. zeplin.io
In 2025, 46% of developers actively distrust AI accuracy, compared with 33% who trust it and only 3% who highly trust it. survey.stackoverflow.co
Product teams juggle tools from an average of 7.6 categories out of 16. figma.com
Only 10% of designers in Telerik's collaboration survey said designer-developer collaboration went smoothly and without challenges. telerik.com
Annotators judged GPT-4V-generated webpages better than the original reference webpages in 64% of cases. salt-nlp.github.io
Figma’s Net Dollar Retention Rate remained 136% as customers expanded both seats and AI credit add-ons. investor.figma.com
The argument
Daily AI use has already reached 51% among professional developers, but 46% distrust its accuracy.
Role boundaries are blurring: 64% of product creators already perform two or more functions.
Frontend generation is advancing, although visual appearance still does not prove functionality or accessibility.
Copilot reduced time by 55% on a bounded task, but experts took 19% longer on familiar systems.
In 2026, 95.9% of one million pages still had WCAG issues detectable automatically.
Generated backend code requires oversight: even the best models fail some security tests.
Teams already work with tools across 7.6 categories, so integrating the work matters as much as generating it.
Sustainable results depend on measuring quality, security, accessibility, and cost, not just output.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
La IA ya atraviesa diseño, frontend y backend, pero velocidad no garantiza calidad. La ventaja será convertir ideas en software verificable sin perder accesibilidad, seguridad, contexto ni juicio humano.
Hallazgos clave
En 2025, 16 desarrolladores expertos completaron 246 tareas 19% más lento con IA, aunque esperaban ser 24% más rápidos. Model Evaluation and Threat Research
El ensayo aleatorizado de METR encontró que desarrolladores experimentados de código abierto tardaron un 19 % más al usar herramientas de IA de principios de 2025. metr.org
En 2025, 94,8% del millón de páginas analizadas por WebAIM tenía fallos WCAG detectables automáticamente. WebAIM
En SWE-bench Verified, el rendimiento comparable avanzó de 33,2% en 2024 a 65% en 2025 y 76,8% en febrero de 2026. OpenAI
En un experimento con 95 profesionales, Copilot redujo 55% el tiempo y elevó la finalización de 70% a 78%. GitHub
En 2025, los fallos más comunes afectaban contraste, 79,1%; texto alternativo, 55,5%; etiquetas, 48,2%; enlaces vacíos, 45,4%; botones vacíos, 29,6%; e idioma, 15,8%. WebAIM
La encuesta de Design Delivery de UX Tools encontró que el 90% reporta productos finales que no coinciden, el 80% cambios omitidos y el 55% elementos incorrectos del sistema de diseño. zeplin.io
En 2025, el 46% de los desarrolladores desconfía activamente de la precisión de la IA, frente al 33% que confía y apenas el 3% que confía mucho. survey.stackoverflow.co
Los equipos de producto manejan herramientas de un promedio de 7,6 categorías entre 16 posibles. figma.com
Solo el 10% de los diseñadores en la encuesta de colaboración de Telerik dijo que la colaboración entre diseño y desarrollo fluía sin dificultades. telerik.com
Los evaluadores consideraron que las páginas generadas por GPT-4V eran mejores que las originales en el 64% de los casos. salt-nlp.github.io
La retención neta de ingresos de Figma se mantuvo en 136%, mientras los clientes ampliaron tanto sus puestos como sus complementos de créditos de IA. investor.figma.com
El argumento
El uso diario de IA ya alcanza 51% entre desarrolladores profesionales, pero 46% desconfía de su precisión.
Los límites de los roles se diluyen: 64% de los creadores de producto ya cumple dos o más funciones.
La generación de frontend avanza, aunque la apariencia visual todavía no prueba funcionalidad ni accesibilidad.
Copilot redujo 55% el tiempo en una tarea delimitada, pero expertos tardaron 19% más en sistemas conocidos.
En 2026, 95,9% de un millón de páginas todavía tenía fallas WCAG detectables automáticamente.
El backend generado exige controles: hasta los mejores modelos fallan parte de las pruebas de seguridad.
Los equipos ya manejan herramientas de 7,6 categorías, por lo que integrar el trabajo importa tanto como generarlo.
El resultado sostenible depende de medir calidad, seguridad, accesibilidad y costo, no solo producción.
Esta investigación se publica en inglés y español. Read in English