# Speech and Audio Processing

**Type:** Topics  
**Canonical URL:** https://scholariq.org/topics/speech-and-audio-processing/

## Facts

| Field | Value |
| --- | --- |
| Description | This cluster of papers focuses on the advances in speech enhancement techniques, including audio-visual speech recognition, deep learning methods, noise reduction, source separation, reverberation handling, objective quality measures, beamforming, and lipreading. The papers cover a wide range of topics related to improving the quality and intelligibility of speech signals in various challenging acoustic environments. |
| Domain | Physical Sciences |
| Field | Computer Science |
| OpenAlex ID | t10860 |
| Works | 154 |

## Topic papers all

Showing 15 of 154.

- [Online dictionary learning for sparse coding](https://scholariq.org/papers/online-dictionary-learning-for-sparse-coding/)
- [Maximum likelihood multiple-source localization using acoustic energy measurements with wireless sensor networks](https://scholariq.org/papers/maximum-likelihood-multiple-source-localization-using-acoustic-energy/)
- [SoundSense](https://scholariq.org/papers/soundsense/)
- [Invariant cues for place of articulation in stop consonants](https://scholariq.org/papers/invariant-cues-for-place-of-articulation-in-stop-consonants/)
- [Transformer Transducer: A Streamable Speech Recognition Model with Transformer Encoders and RNN-T Loss](https://scholariq.org/papers/transformer-transducer-a-streamable-speech-recognition-model-with-transformer/)
- [Acoustic invariance in speech production: Evidence from measurements of the spectral characteristics of stop consonants](https://scholariq.org/papers/acoustic-invariance-in-speech-production-evidence-from-measurements-of-the/)
- [A Comprehensive Review of Speech Emotion Recognition Systems](https://scholariq.org/papers/a-comprehensive-review-of-speech-emotion-recognition-systems/)
- [Very deep convolutional neural networks for raw waveforms](https://scholariq.org/papers/very-deep-convolutional-neural-networks-for-raw-waveforms/)
- [Energy-Based Collaborative Source Localization Using Acoustic Microsensor Array](https://scholariq.org/papers/energy-based-collaborative-source-localization-using-acoustic-microsensor-array/)
- [Broadband minimum variance beamforming for ultrasound imaging](https://scholariq.org/papers/broadband-minimum-variance-beamforming-for-ultrasound-imaging/)
- [ARIADNE](https://scholariq.org/papers/ariadne/)
- [Feature parsing: Feature cue mapping in spoken word recognition](https://scholariq.org/papers/feature-parsing-feature-cue-mapping-in-spoken-word-recognition/)
- [Augmentation of Fingerprints for Indoor WiFi Localization Based on Gaussian Process Regression](https://scholariq.org/papers/augmentation-of-fingerprints-for-indoor-wifi-localization-based-on-gaussian/)
- [Cochlear Implant Failures and Revision](https://scholariq.org/papers/cochlear-implant-failures-and-revision/)
- [Automatic Lip-Contour Extraction and Mouth-Structure Segmentation in Images](https://scholariq.org/papers/automatic-lip-contour-extraction-and-mouth-structure-segmentation-in-images/)

## Topic primary papers

Showing 15 of 22.

- [Maximum likelihood multiple-source localization using acoustic energy measurements with wireless sensor networks](https://scholariq.org/papers/maximum-likelihood-multiple-source-localization-using-acoustic-energy/)
- [Energy-Based Collaborative Source Localization Using Acoustic Microsensor Array](https://scholariq.org/papers/energy-based-collaborative-source-localization-using-acoustic-microsensor-array/)
- [Automatic Lip-Contour Extraction and Mouth-Structure Segmentation in Images](https://scholariq.org/papers/automatic-lip-contour-extraction-and-mouth-structure-segmentation-in-images/)
- [Complex Stapes Motions in Human Ears](https://scholariq.org/papers/complex-stapes-motions-in-human-ears/)
- [Kalman Filters for Time Delay of Arrival-Based Source Localization](https://scholariq.org/papers/kalman-filters-for-time-delay-of-arrival-based-source-localization/)
- [A joint particle filter for audio-visual speaker tracking](https://scholariq.org/papers/a-joint-particle-filter-for-audio-visual-speaker-tracking/)
- [Deep Extractor Network for Target Speaker Recovery from Single Channel Speech Mixtures](https://scholariq.org/papers/deep-extractor-network-for-target-speaker-recovery-from-single-channel-speech/)
- [Avoiding over-estimation in bandwidth extension of telephony speech](https://scholariq.org/papers/avoiding-over-estimation-in-bandwidth-extension-of-telephony-speech/)
- [Emotion recognition on the basis of audio signal using Naive Bayes classifier](https://scholariq.org/papers/emotion-recognition-on-the-basis-of-audio-signal-using-naive-bayes-classifier/)
- [Kalman filters for audio-video source localization](https://scholariq.org/papers/kalman-filters-for-audio-video-source-localization/)
- [Lip Reading Using Convolutional Neural Networks with and without Pre-Trained Models](https://scholariq.org/papers/lip-reading-using-convolutional-neural-networks-with-and-without-pre-trained/)
- [Voice conversion for emotional speech: Rule-based synthesis with degree of emotion controllable in dimensional space](https://scholariq.org/papers/voice-conversion-for-emotional-speech-rule-based-synthesis-with-degree-of/)
- [Adaptive Beamforming With a Minimum Mutual Information Criterion](https://scholariq.org/papers/adaptive-beamforming-with-a-minimum-mutual-information-criterion/)
- [Simultaneous localization of mobile robot and multiple sound sources using microphone array](https://scholariq.org/papers/simultaneous-localization-of-mobile-robot-and-multiple-sound-sources-using/)
- [Audio-Visual End-to-End Multi-Channel Speech Separation, Dereverberation and Recognition](https://scholariq.org/papers/audio-visual-end-to-end-multi-channel-speech-separation-dereverberation-and/)

---
Source: ScholarIQ — public research metadata, principally OpenAlex. See https://scholariq.org/sources/ for provenance and https://scholariq.org/methodology/ for what these figures mean.
