Los deepfakes de voz en español: bases de datos y revisión de marcos regulatorios

Abstract

El desarrollo de tecnologías de clonación y síntesis de voz mediante inteligencia artificial ha intensificado los desafíos lingüísticos, sociales y legales asociados al uso de la voz como rasgo personal y objeto de análisis filológico, especialmente en español. El objetivo de este artículo es doble: por un lado, revisar críticamente las bases de datos existentes para el estudio de deepfakes de voz en español desde una perspectiva fonética; y por otro, examinar minuciosamente los marcos jurídicos que regulan la creación y el tratamiento de bancos de voces clonadas. La metodología combina una revisión bibliográfica de corpus de habla sintética y estudios previos en fonética y percepción, con un análisis jurídico detallado del RGPD, el Reglamento Europeo de Inteligencia Artificial y las directrices españolas sobre gestión del riesgo. Los resultados demuestran una notable escasez de recursos lingüísticos en español y la ausencia de criterios explícitos de trazabilidad y etiquetado del habla sintética, así como la necesidad de integrar consideraciones éticas y legales en el diseño de corpus fonéticos. Se concluye que, en un contexto de investigación, la creación de bancos de voces clonadas no constituye un sistema de alto riesgo si se fundamenta en el consentimiento informado y en una gestión proporcional del riesgo.

Publication
Lengua y Sociedad. Revista de Lingüística Teórica y Aplicada, 25(1), e32338