Ideación visual mediada por inteligencia artificial generativa: diversidad léxica, complejidad de prompts y configuraciones de generación en DiffusionDB
DOI:
https://doi.org/10.64747/2mgg3g14Palabras clave:
inteligencia artificial generativa, ideación visual, ingeniería de prompts, creatividad computacional, análisis de contenido, DiffusionDBResumen
La escritura de prompts constituye una fase observable de la ideación en los sistemas generativos texto-imagen, pero su diversidad, recurrencia y relación con las configuraciones de generación requieren una delimitación que evite equiparar complejidad textual con creatividad psicológica. El objetivo fue caracterizar la ideación visual expresada en los prompts públicos de DiffusionDB mediante su diversidad léxica, elaboración estructural, recurrencia y asociación con parámetros de generación. Se realizó un estudio observacional transversal de datos secundarios. Se auditaron los 2.000.000 de registros de DiffusionDB 2M; el análisis textual utilizó 1.999.397 prompts no vacíos, 1.522.692 formulaciones únicas normalizadas y una submuestra determinista de 100.000 prompts para métricas léxicas. La mediana fue de 21 palabras y cinco segmentos. El 23,84 % de los registros correspondió a formulaciones repetidas. Los marcadores explícitos más frecuentes fueron medio o técnica (57,35 %), estilo o artista (55,28 %) y calidad o detalle (45,46 %). El índice de elaboración presentó mediana de dos categorías; 60,65 % de los registros combinó dos o más recursos visuales. Las correlaciones entre longitud y parámetros fueron pequeñas dentro de usuario (r = 0,12–0,16) y moderadas entre usuarios (rho = 0,33–0,51). Los prompts funcionaron como ensamblajes compositivos relativamente ricos, aunque apoyados en fórmulas recurrentes. Los resultados describen prácticas tempranas de ideación con Stable Diffusion, no creatividad humana ni calidad visual.
Referencias
Covington, M. A., & McFall, J. D. (2010). Cutting the Gordian knot: The moving-average type-token ratio (MATTR). Journal of Quantitative Linguistics, 17(2), 94–100. https://doi.org/10.1080/09296171003643098
De Rosa Palmini, M.-T., & Cetinic, E. (2024). Patterns of creativity: How user input shapes AI-generated visual diversity [Preprint]. arXiv. https://arxiv.org/abs/2410.06768
Doshi, A. R., & Hauser, O. P. (2024). Generative AI enhances individual creativity but reduces the collective diversity of novel content. Science Advances, 10(28), eadn5290. https://doi.org/10.1126/sciadv.adn5290
Epstein, Z., Hertzmann, A., Akten, M., Farid, H., Fjeld, J., Frank, M. R., Groh, M., Herman, L., Leach, N., Mahari, R., Pentland, A. S., Russakovsky, O., Schroeder, H., & Smith, A. (2023). Art and the science of generative AI. Science, 380(6650), 1110–1111. https://doi.org/10.1126/science.adh4451
Feng, Y., Wang, X., Wong, K. K., Wang, S., Lu, Y., Zhu, M., Wang, B., & Chen, W. (2023). PromptMagician: Interactive prompt engineering for text-to-image creation. IEEE Transactions on Visualization and Computer Graphics, 1–11. https://doi.org/10.1109/TVCG.2023.3327168
Liu, V., & Chilton, L. B. (2022). Design guidelines for prompt engineering text-to-image generative models. In Proceedings of the 2022 CHI Conference on Human Factors in Computing Systems (pp. 1–23). Association for Computing Machinery. https://doi.org/10.1145/3491102.3501825
McCarthy, P. M., & Jarvis, S. (2010). MTLD, vocd-D, and HD-D: A validation study of sophisticated approaches to lexical diversity assessment. Behavior Research Methods, 42(2), 381–392. https://doi.org/10.3758/BRM.42.2.381
Oppenlaender, J., Linder, R., & Silvennoinen, J. (2024). Prompting AI art: An investigation into the creative skill of prompt engineering. International Journal of Human–Computer Interaction. Advance online publication. https://doi.org/10.1080/10447318.2024.2431761
Ramesh, A., Dhariwal, P., Nichol, A., Chu, C., & Chen, M. (2022). Hierarchical text-conditional image generation with CLIP latents [Preprint]. arXiv. https://arxiv.org/abs/2204.06125
Rombach, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2022). High-resolution image synthesis with latent diffusion models. In 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 10674–10685). IEEE. https://doi.org/10.1109/CVPR52688.2022.01042
Saharia, C., Chan, W., Saxena, S., Li, L., Whang, J., Denton, E., Seyed Ghasemipour, S. K., Ayan, B. K., Mahdavi, S. S., Lopes, R. G., Salimans, T., Ho, J., Fleet, D. J., & Norouzi, M. (2022). Photorealistic text-to-image diffusion models with deep language understanding [Preprint]. arXiv. https://arxiv.org/abs/2205.11487
Wadinambiarachchi, S., Kelly, R. M., Pareek, S., Zhou, Q., & Velloso, E. (2024). The effects of generative AI on design fixation and divergent thinking. In Proceedings of the CHI Conference on Human Factors in Computing Systems (pp. 1–18). Association for Computing Machinery. https://doi.org/10.1145/3613904.3642919
Wang, Z. J., Montoya, E., Munechika, D., Yang, H., Hoover, B., & Chau, D. H. (2022). DiffusionDB: A large-scale prompt gallery dataset for text-to-image generative models [Preprint]. arXiv. https://arxiv.org/abs/2210.14896
Zhou, E., & Lee, D. (2024). Generative artificial intelligence, human creativity, and art. PNAS Nexus, 3(3), pgae052. https://doi.org/10.1093/pnasnexus/pgae052
Descargas
Publicado
Versiones
- 2025-06-29 (2)
- 2025-06-29 (1)
Número
Sección
Licencia
Derechos de autor 2025 MARIA FERNANDA RODRIGUEZ-RUIZ (Autor/a)

Esta obra está bajo una licencia internacional Creative Commons Atribución 4.0.
Las personas autoras conservan sus derechos y otorgan a Sapiens Global el derecho de primera publicación. El artículo se distribuye bajo CC BY 4.0, salvo indicación diferente para material de terceros.