# Multimodal Machine Learning Applications

**Type:** Topics  
**Canonical URL:** https://scholariq.org/topics/multimodal-machine-learning-applications/

## Facts

| Field | Value |
| --- | --- |
| Description | This cluster of papers focuses on the development and improvement of visual question answering systems, image captioning techniques, and neural networks for understanding and generating descriptions of images and videos. The research involves semantic reasoning, multimodal fusion, scene graph generation, attention mechanisms, and deep learning approaches to bridge the gap between vision and language. |
| Domain | Physical Sciences |
| Field | Computer Science |
| OpenAlex ID | t11714 |
| Works | 106 |

## Topic papers all

Showing 15 of 106.

- [ImageNet: A large-scale hierarchical image database](https://scholariq.org/papers/imagenet-a-large-scale-hierarchical-image-database/)
- [Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations](https://scholariq.org/papers/visual-genome-connecting-language-and-vision-using-crowdsourced-dense-image/)
- [Deep visual-semantic alignments for generating image descriptions](https://scholariq.org/papers/deep-visual-semantic-alignments-for-generating-image-descriptions/)
- [TinyBERT: Distilling BERT for Natural Language Understanding](https://scholariq.org/papers/tinybert-distilling-bert-for-natural-language-understanding/)
- [A Comprehensive Survey of Deep Learning for Image Captioning](https://scholariq.org/papers/a-comprehensive-survey-of-deep-learning-for-image-captioning/)
- [End-to-End Learning of Action Detection from Frame Glimpses in Videos](https://scholariq.org/papers/end-to-end-learning-of-action-detection-from-frame-glimpses-in-videos/)
- [Fusing audio, visual and textual clues for sentiment analysis from multimodal content](https://scholariq.org/papers/fusing-audio-visual-and-textual-clues-for-sentiment-analysis-from-multimodal/)
- [Self-challenging Improves Cross-Domain Generalization](https://scholariq.org/papers/self-challenging-improves-cross-domain-generalization/)
- [VaTeX: A Large-Scale, High-Quality Multilingual Dataset for Video-and-Language Research](https://scholariq.org/papers/vatex-a-large-scale-high-quality-multilingual-dataset-for-video-and-language/)
- [SpotTune: Transfer Learning Through Adaptive Fine-Tuning](https://scholariq.org/papers/spottune-transfer-learning-through-adaptive-fine-tuning/)
- [Long Text Generation via Adversarial Training with Leaked Information](https://scholariq.org/papers/long-text-generation-via-adversarial-training-with-leaked-information/)
- [GLoRIA: A Multimodal Global-Local Representation Learning Framework for Label-efficient Medical Image Recognition](https://scholariq.org/papers/gloria-a-multimodal-global-local-representation-learning-framework-for-label/)
- [A Hierarchical Approach for Generating Descriptive Image Paragraphs](https://scholariq.org/papers/a-hierarchical-approach-for-generating-descriptive-image-paragraphs/)
- [Every Moment Counts: Dense Detailed Labeling of Actions in Complex Videos](https://scholariq.org/papers/every-moment-counts-dense-detailed-labeling-of-actions-in-complex-videos/)
- [A Storytelling Robot: Modeling and Evaluation of Human-like Gaze Behavior](https://scholariq.org/papers/a-storytelling-robot-modeling-and-evaluation-of-human-like-gaze-behavior/)

## Topic primary papers

Showing 15 of 36.

- [Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations](https://scholariq.org/papers/visual-genome-connecting-language-and-vision-using-crowdsourced-dense-image/)
- [Deep visual-semantic alignments for generating image descriptions](https://scholariq.org/papers/deep-visual-semantic-alignments-for-generating-image-descriptions/)
- [A Comprehensive Survey of Deep Learning for Image Captioning](https://scholariq.org/papers/a-comprehensive-survey-of-deep-learning-for-image-captioning/)
- [VaTeX: A Large-Scale, High-Quality Multilingual Dataset for Video-and-Language Research](https://scholariq.org/papers/vatex-a-large-scale-high-quality-multilingual-dataset-for-video-and-language/)
- [GLoRIA: A Multimodal Global-Local Representation Learning Framework for Label-efficient Medical Image Recognition](https://scholariq.org/papers/gloria-a-multimodal-global-local-representation-learning-framework-for-label/)
- [A Hierarchical Approach for Generating Descriptive Image Paragraphs](https://scholariq.org/papers/a-hierarchical-approach-for-generating-descriptive-image-paragraphs/)
- [Spatio-Temporal Graph for Video Captioning With Knowledge Distillation](https://scholariq.org/papers/spatio-temporal-graph-for-video-captioning-with-knowledge-distillation/)
- [ViTAA: Visual-Textual Attributes Alignment in Person Search by Natural Language](https://scholariq.org/papers/vitaa-visual-textual-attributes-alignment-in-person-search-by-natural-language/)
- [Multimodal Co-learning: Challenges, applications with datasets, recent advances and future directions](https://scholariq.org/papers/multimodal-co-learning-challenges-applications-with-datasets-recent-advances-and/)
- [Listen, Attend, and Walk: Neural Mapping of Navigational Instructions to Action Sequences](https://scholariq.org/papers/listen-attend-and-walk-neural-mapping-of-navigational-instructions-to-action/)
- [Listen, Attend, and Walk: Neural Mapping of Navigational Instructions to Action Sequences](https://scholariq.org/papers/listen-attend-and-walk-neural-mapping-of-navigational-instructions-to-action-2/)
- [Image Understanding using vision and reasoning through Scene Description Graph](https://scholariq.org/papers/image-understanding-using-vision-and-reasoning-through-scene-description-graph/)
- [w4225512839](https://scholariq.org/papers/w4225512839/)
- [Cross-Modal Prototype Driven Network for Radiology Report Generation](https://scholariq.org/papers/cross-modal-prototype-driven-network-for-radiology-report-generation/)
- [LaTr: Layout-Aware Transformer for Scene-Text VQA](https://scholariq.org/papers/latr-layout-aware-transformer-for-scene-text-vqa/)

---
Source: ScholarIQ — public research metadata, principally OpenAlex. See https://scholariq.org/sources/ for provenance and https://scholariq.org/methodology/ for what these figures mean.
