Titre de projet : Développement d'un système embarqué de reconnaissance vocale en français pour l'assistance aux personnes malvoyantes utilisant l'apprentissage profond et l'Edge AI
Table Of Contents
Chapter ONE
INTRODUCTION
- 1.1Introduction
- 1.2Background of study
- 1.3Problem Statement
- 1.4Objective of study
- 1.5Limitation of study
- 1.6Scope of study
- 1.7Significance of study
- 1.8Structure of the research
- 1.9Definition of terms
Chapter TWO
LITERATURE REVIEW
- 2.1Review of existing systems and architectures for speech recognition in French
- 2.2Theoretical foundations of deep learning for NLP and ASR
- 2.3Edge AI and on-device inference techniques
- 2.4French phonetics and linguistic characteristics relevant to ASR
- 2.5Noise robustness and acoustic modeling in French
- 2.6End-user accessibility requirements for visually impaired users
- 2.7Comparisons of open-source ASR frameworks (Kaldi, DeepSpeech, ESPnet)
- 2.8Data collection and annotation methodologies in French
- 2.9Evaluation metrics for ASR systems
- 2.10Summary of gaps and research opportunities
Chapter THREE
RESEARCH METHODOLOGY
- 3.1Research design and approach
- 3.2Data collection and preprocessing
- 3.3Corpus construction for French speech recognition
- 3.4Feature extraction and representation (MFCC, Mel-spectrograms, etc.)
- 3.5Model architecture selection (RNNs, CNNs, Transformers)
- 3.6Training strategies and hyperparameter tuning
- 3.7On-device inference optimization (quantization, pruning, distillation)
- 3.8Evaluation protocol and baseline comparisons
- 3.9Ethical considerations and participant consent
- 3.10Validation and reliability analysis
Chapter FOUR
DATA PRESENTATION AND ANALYSIS
- 4.1System design overview
- 4.2Data pipeline and streaming processing
- 4.3Acoustic model development and training results
- 4.4Language model integration and decoding strategies
- 4.5Edge deployment framework and hardware platform specifications
- 4.6Noise robustness experiments and results
- 4.7User testing with visually impaired participants: methodology and findings
- 4.8Discussion of results: performance, limitations, and improvement opportunities
Chapter FIVE
SUMMARY, CONCLUSION AND RECOMMENDATIONS
- 5.1Summary of research objectives and findings
- 5.2Theoretical contributions and practical implications
- 5.3System evaluation against benchmarks
- 5.4Limitations and risk assessment
- 5.5Recommendations for future work
- 5.6Conclusion and final remarks
Project Abstract
Ce travail présente le développement d’un système embarqué de reconnaissance vocale en français dédié à l’assistance des personnes malvoyantes, intégrant des techniques d’apprentissage profond et d’Edge AI pour une efficacité et une confidentialité accrues. L’objectif principal est de concevoir une solution légère, robuste et capable de fonctionner en temps réel sur des dispositifs à ressources limitées (microcontrôleurs et micro-ordinateurs embarqués), sans dépendance constante à une connexion réseau. Le système est articulé autour d’un pipeline vocal complet comprenant l’acoustique, la reconnaissance et la compréhension, ainsi que des modules d’interaction multimodale pour améliorer l’accessibilité au quotidien. Sur le plan acoustique, nous proposons une représentation spectrale adaptée au français (incluant des variantes dialectales et des bruits de fond typiques) et un apprentissage supervisé par transfert provenant de grandes bases de données multilingues, afin de maximiser la précision tout en minimisant la latence. Pour la reconnaissance, un modèle hybride léger, combinant des réseaux convolutifs et des transformeurs quantifiés pour réduire l’empreinte mémoire, est entraîné sur des corpus francophones variés (littéral, conversationnel et commandes). Le modèle est optimisé via techniques d’optimisation quantifiée et distillation de connaissances afin d’être déployé sur des architectures embarquées comme ARM Cortex-M et Raspberry Pi, tout en garantissant une performance comparable à des systèmes basés sur le cloud. La compréhension et la classification des intents sont réalisées à l’aide d’un classificateur multi-objectif capable de traiter des commandes courtes et des phrases complexes, avec une capacité de révision contextuelle locale pour améliorer la pertinence des réponses en situation d’assistance. Le système intègre également une synthèse vocale française naturelle, adaptée à la voix des utilisateurs malvoyants, et une gestion des défauts naturels (répétition, hésitation, amplification du bruit) pour assurer une interaction fluide et fiable. Un composant de détection de parole et d’activité vocale, robuste aux environnements bruyants, est combiné à des mécanismes d’auto-apprentissage en bordure pour adapter le modèle au profil vocal de chaque utilisateur sans compromettre la sécurité des données. Pour évaluer le système, des scénarios d’usabilité et des mesures objectives (taux de reconnaissance, latence, précision des commandes, consommation énergétique et robustesse au bruit) seront effectués dans des environnements domestiques simulés et réels. Les résultats seront comparés à des solutions non embarquées et à des systèmes existants afin de démontrer les gains en latence, confidentialité et accessibilité. Ce travail vise à proposer un cadre reproductible et déployable pour des applications d’assistance autonome, tout en ouvrant des perspectives d’extension vers d’autres langues et domaines d’aide à la mobilité et à la communication des personnes malvoyantes.
Project Overview
What This Project Is About
The project aims to create a compact voice recognition system that works directly on a small device, like a wearable or a handheld gadget, and understands French to help people who are blind or have low vision. It combines simple audio processing with smart learning methods to turn spoken French into commands or text without needing a constant internet connection.
The Problem It Addresses
Many assistive technologies rely on cloud services, which can be slow, require internet access, or raise privacy concerns. A local, embedded solution can run faster, protect user data, and work in places without reliable connectivity while still understanding natural French speech.
Objectives of the Project
- Design a small, energy-efficient speech recognition model suitable for embedded hardware.
- Enable offline operation so processing happens on the device itself.
- Ensure the system understands French under different lighting, noise, and accent conditions.
- Provide a simple interface to convert speech to text or to trigger actions.
- Evaluate usability with target users and measure performance metrics.
What You Will Do Step by Step
1. Review basic literature on embedded AI and French speech datasets. 2. Collect or curate short French voice samples that cover common commands. 3. Build a lightweight model architecture optimized for edge devices. 4. Train and validate the model offline, adjusting for accuracy and latency. 5. Implement a user-friendly interface for outputs. 6. Test robustness with real-world scenarios and different microphones. 7. Compare energy use and speed to cloud-based alternatives. 8. Document design decisions and limitations.
Expected Outcome
A functional, offline French speech recognition system on an embedded device with acceptable accuracy and low latency, accompanied by a user guide and a performance report highlighting its benefits for visually impaired users.