<?xml version="1.0" encoding="UTF-8"?><?xml-stylesheet type="text/xsl" href="static/CINECAstyle.xsl"?><OAI-PMH xmlns="http://www.openarchives.org/OAI/2.0/" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation="http://www.openarchives.org/OAI/2.0/ http://www.openarchives.org/OAI/2.0/OAI-PMH.xsd"><responseDate>2026-09-25T01:00:28Z</responseDate><request verb="GetRecord" identifier="oai:www.iris.unict.it:20.500.11769/724673" metadataPrefix="oai_dc">https://www.iris.unict.it/oai/request</request><GetRecord><record><header><identifier>oai:www.iris.unict.it:20.500.11769/724673</identifier><datestamp>2026-07-02T08:40:49Z</datestamp><setSpec>com_20.500.11769_434851</setSpec><setSpec>com_123456789_40</setSpec><setSpec>col_20.500.11769_434852</setSpec></header><metadata><oai_dc:dc xmlns:oai_dc="http://www.openarchives.org/OAI/2.0/oai_dc/" xmlns:doc="http://www.lyncode.com/xoai" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xmlns:dc="http://purl.org/dc/elements/1.1/" xsi:schemaLocation="http://www.openarchives.org/OAI/2.0/oai_dc/ http://www.openarchives.org/OAI/2.0/oai_dc.xsd">
<dc:title>Understanding the Phenomenon of Deepfake Audio: Challenges and Solutions [Comprendere il fenomeno dell'audio deepfake: sfide e soluzioni]</dc:title>
<dc:creator>BORZI', STEFANO</dc:creator>
<dc:contributor>Borzi', Stefano</dc:contributor>
<dc:contributor>ALLEGRA, DARIO</dc:contributor>
<dc:subject>Deepfake audio</dc:subject>
<dc:subject> Synthetic speech detection</dc:subject>
<dc:subject> Voice cloning</dc:subject>
<dc:subject> Handcrafted feature</dc:subject>
<dc:subject> Machine Learning</dc:subject>
<dc:subject> artificial intelligence</dc:subject>
<dc:subject> Silence analysi</dc:subject>
<dc:subject> Audio Forensic</dc:subject>
<dc:subject> Synthetic speech attribution (SSA)</dc:subject>
<dc:subject> Explainable AI</dc:subject>
<dc:subject> Deepfake audio detection</dc:subject>
<dc:subject>Deepfake audio</dc:subject>
<dc:subject> Synthetic speech detection</dc:subject>
<dc:subject> Clonazione della voce</dc:subject>
<dc:subject> Handcrafted feature</dc:subject>
<dc:subject> Machine Learning</dc:subject>
<dc:subject> intelligenza artificiale</dc:subject>
<dc:subject> Analisi del silenzio</dc:subject>
<dc:subject> Audio forense</dc:subject>
<dc:subject> Synthetic speech attribution (SSA)</dc:subject>
<dc:subject> Deepfake audio detection</dc:subject>
<dc:description>Questa tesi analizza le crescenti sfide poste dall'audio deepfake, concentrandosi sul rilevamento e l'attribuzione delle voci sintetiche. Con la crescente accessibilità e sofisticazione delle tecnologie di sintesi vocale, il rilevamento dell'audio sintetico è diventato un compito cruciale nell'ambito dell'informatica forense, della sicurezza informatica e dell'integrità dei media. La ricerca esplora le feature create manualmente come alternativa interpretabile e computazionalmente efficiente ai metodi basati sul deep learning, garantendo robustezza su diversi set di dati, attività di audio sintetico complesse, condizioni di rumore e ambienti di registrazione. Lo studio è strutturato attorno a molteplici attività, tra cui la classificazione binaria di audio reale e falso, l'attribuzione del parlato sintetico (SSA), un'analisi approfondita dei segmenti silenziosi nel rilevamento del parlato sintetico e un'attività di reverse engineering relativa alla generazione di audio sintetico. Un contributo chiave è l'introduzione del dataset Synthetic Obama-Trump Speeches (SOS), progettato per valutare i modelli in condizioni reali e facilitare esperimenti di apprendimento a pochi scatti. Inoltre, sono state sviluppate un'applicazione web e la libreria Python SPAFE per migliorare l'analisi delle feature e l'interoperabilità della ricerca. I risultati sperimentali confermano che le caratteristiche artigianali non solo raggiungono un'elevata accuratezza nel rilevamento del parlato sintetico, ma si generalizzano efficacemente anche tra i vari set di dati. L'analisi dei segmenti silenziosi ne evidenzia il ruolo cruciale nel migliorare le prestazioni di rilevamento, mentre gli esperimenti SSA e l'identificazione dei parametri di generazione del rumore di Barkhausen tramite reverse engineering dimostrano la versatilità della tecnica artigianale. Inoltre, lo studio sottolinea l'importanza della spiegabilità nei sistemi di rilevamento basati sull'intelligenza artificiale, garantendo trasparenza e affidabilità nelle applicazioni reali. Combinando nuovi set di dati, metodologie spiegabili e strumenti pratici, questa tesi contribuisce al progresso della ricerca sull'audio sintetico e fornisce una solida base per ulteriori progressi in tecniche di rilevamento robuste, interpretabili ed efficienti.</dc:description>
<dc:description>This thesis investigates the growing challenges posed by deepfake audio, focusing on the detection and attribution of synthetic speech. With the increasing accessibility and sophistication of voice synthesis technologies, detecting synthetic audio has become a crucial task in digital forensics, cybersecurity, and media integrity. The research explores handcrafted features as an interpretable and computationally efficient alternative to deep learning-based methods, ensuring robustness across diverse datasets, challenging synthetic audio tasks, noise conditions, and recording environments. The study is structured around multiple tasks, including binary classification of real vs. fake audio, Synthetic Speech Attribution (SSA), an in-depth analysis of silent segments in synthetic speech detection and a reverse engineering task related to the generation of synthetic audio. A key contribution is the introduction of the Synthetic Obama-Trump Speeches (SOS) dataset, designed to evaluate models under real-world conditions and facilitate few-shot learning experiments. Additionally, a web application and the SPAFE Python library were developed to enhance feature analysis and research interoperability.&#xd;
Experimental results confirm that handcrafted features not only achieve high accuracy in detecting synthetic speech but also generalize effectively across datasets. The analysis of silent segments highlights their critical role in enhancing detection performance, while SSA experiments and the identification of Barkhausen noise generation parameters through reverse engineering demonstrate the versatility of the handcrafted technique. Furthermore, the study underscores the importance of explainability in AI-driven detection systems, ensuring transparency and reliability in real-world applications. By combining novel datasets, explainable methodologies, and practical tools, this thesis contributes to the advancement of synthetic audio research and provides a solid basis for further progress in robust, interpretable, and efficient detection techniques.</dc:description>
<dc:date>2026-02-20</dc:date>
<dc:type>info:eu-repo/semantics/doctoralThesis</dc:type>
<dc:identifier>https://hdl.handle.net/20.500.11769/724673</dc:identifier>
<dc:language>eng</dc:language>
<dc:rights>info:eu-repo/semantics/openAccess</dc:rights>
<dc:publisher>Università degli studi di Catania</dc:publisher>
<dc:publisher>place:Catania</dc:publisher>
<dc:rights>license:PUBBLICO - Pubblico con Copyright</dc:rights>
<dc:rights>license uri:iris.PUB02</dc:rights>
</oai_dc:dc></metadata></record></GetRecord></OAI-PMH>