Ideación visual mediada por inteligencia artificial generativa: diversidad léxica, complejidad de prompts y configuraciones de generación en DiffusionDB

Autores/as

  • MARIA FERNANDA RODRIGUEZ-RUIZ UNIVERSIDAD DE GUAYAQUIL Autor/a

DOI:

https://doi.org/10.64747/2mgg3g14

Palabras clave:

inteligencia artificial generativa, ideación visual, ingeniería de prompts, creatividad computacional, análisis de contenido, DiffusionDB

Resumen

La escritura de prompts constituye una fase observable de la ideación en los sistemas generativos texto-imagen, pero su diversidad, recurrencia y relación con las configuraciones de generación requieren una delimitación que evite equiparar complejidad textual con creatividad psicológica. El objetivo fue caracterizar la ideación visual expresada en los prompts públicos de DiffusionDB mediante su diversidad léxica, elaboración estructural, recurrencia y asociación con parámetros de generación. Se realizó un estudio observacional transversal de datos secundarios. Se auditaron los 2.000.000 de registros de DiffusionDB 2M; el análisis textual utilizó 1.999.397 prompts no vacíos, 1.522.692 formulaciones únicas normalizadas y una submuestra determinista de 100.000 prompts para métricas léxicas. La mediana fue de 21 palabras y cinco segmentos. El 23,84 % de los registros correspondió a formulaciones repetidas. Los marcadores explícitos más frecuentes fueron medio o técnica (57,35 %), estilo o artista (55,28 %) y calidad o detalle (45,46 %). El índice de elaboración presentó mediana de dos categorías; 60,65 % de los registros combinó dos o más recursos visuales. Las correlaciones entre longitud y parámetros fueron pequeñas dentro de usuario (r = 0,12–0,16) y moderadas entre usuarios (rho = 0,33–0,51). Los prompts funcionaron como ensamblajes compositivos relativamente ricos, aunque apoyados en fórmulas recurrentes. Los resultados describen prácticas tempranas de ideación con Stable Diffusion, no creatividad humana ni calidad visual.

Referencias

Covington, M. A., & McFall, J. D. (2010). Cutting the Gordian knot: The moving-average type-token ratio (MATTR). Journal of Quantitative Linguistics, 17(2), 94–100. https://doi.org/10.1080/09296171003643098

De Rosa Palmini, M.-T., & Cetinic, E. (2024). Patterns of creativity: How user input shapes AI-generated visual diversity [Preprint]. arXiv. https://arxiv.org/abs/2410.06768

Doshi, A. R., & Hauser, O. P. (2024). Generative AI enhances individual creativity but reduces the collective diversity of novel content. Science Advances, 10(28), eadn5290. https://doi.org/10.1126/sciadv.adn5290

Epstein, Z., Hertzmann, A., Akten, M., Farid, H., Fjeld, J., Frank, M. R., Groh, M., Herman, L., Leach, N., Mahari, R., Pentland, A. S., Russakovsky, O., Schroeder, H., & Smith, A. (2023). Art and the science of generative AI. Science, 380(6650), 1110–1111. https://doi.org/10.1126/science.adh4451

Feng, Y., Wang, X., Wong, K. K., Wang, S., Lu, Y., Zhu, M., Wang, B., & Chen, W. (2023). PromptMagician: Interactive prompt engineering for text-to-image creation. IEEE Transactions on Visualization and Computer Graphics, 1–11. https://doi.org/10.1109/TVCG.2023.3327168

Liu, V., & Chilton, L. B. (2022). Design guidelines for prompt engineering text-to-image generative models. In Proceedings of the 2022 CHI Conference on Human Factors in Computing Systems (pp. 1–23). Association for Computing Machinery. https://doi.org/10.1145/3491102.3501825

McCarthy, P. M., & Jarvis, S. (2010). MTLD, vocd-D, and HD-D: A validation study of sophisticated approaches to lexical diversity assessment. Behavior Research Methods, 42(2), 381–392. https://doi.org/10.3758/BRM.42.2.381

Oppenlaender, J., Linder, R., & Silvennoinen, J. (2024). Prompting AI art: An investigation into the creative skill of prompt engineering. International Journal of Human–Computer Interaction. Advance online publication. https://doi.org/10.1080/10447318.2024.2431761

Ramesh, A., Dhariwal, P., Nichol, A., Chu, C., & Chen, M. (2022). Hierarchical text-conditional image generation with CLIP latents [Preprint]. arXiv. https://arxiv.org/abs/2204.06125

Rombach, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2022). High-resolution image synthesis with latent diffusion models. In 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 10674–10685). IEEE. https://doi.org/10.1109/CVPR52688.2022.01042

Saharia, C., Chan, W., Saxena, S., Li, L., Whang, J., Denton, E., Seyed Ghasemipour, S. K., Ayan, B. K., Mahdavi, S. S., Lopes, R. G., Salimans, T., Ho, J., Fleet, D. J., & Norouzi, M. (2022). Photorealistic text-to-image diffusion models with deep language understanding [Preprint]. arXiv. https://arxiv.org/abs/2205.11487

Wadinambiarachchi, S., Kelly, R. M., Pareek, S., Zhou, Q., & Velloso, E. (2024). The effects of generative AI on design fixation and divergent thinking. In Proceedings of the CHI Conference on Human Factors in Computing Systems (pp. 1–18). Association for Computing Machinery. https://doi.org/10.1145/3613904.3642919

Wang, Z. J., Montoya, E., Munechika, D., Yang, H., Hoover, B., & Chau, D. H. (2022). DiffusionDB: A large-scale prompt gallery dataset for text-to-image generative models [Preprint]. arXiv. https://arxiv.org/abs/2210.14896

Zhou, E., & Lee, D. (2024). Generative artificial intelligence, human creativity, and art. PNAS Nexus, 3(3), pgae052. https://doi.org/10.1093/pnasnexus/pgae052

Descargas

Publicado

2025-06-29 — Actualizado el 2025-06-29

Versiones

Número

Sección

Artículos de investigación

Cómo citar

Ideación visual mediada por inteligencia artificial generativa: diversidad léxica, complejidad de prompts y configuraciones de generación en DiffusionDB. (2025). Sapiens Global, 1(1), 1-9. https://doi.org/10.64747/2mgg3g14