VLDeformer: Vision-Language Decomposed Transformer for fast cross-modal retrieval
Explore this paper's citation graph
Summary
A novel Vision-Language Decomposed Transformer (VLDeformer) is presented, which greatly increases the efficiency of VL transformers while maintaining their outstanding accuracy and outperforms state-of-the-art visual-semantic embedding methods on COCO and Flickr30k.
- Type
- article
- Published
- 2021-10-20
- Cited by
- 26
- References
- 35
- Access
- Open access
- OpenAlex
- https://openalex.org/W3216333240
- Semantic Scholar
- https://api.semanticscholar.org/CorpusID:244478752
Keywords
Transformer, Computer science, Modal, Search engine indexing, Artificial intelligence
References
- Learning Two-Branch Neural Networks for Image-Text Matching Tasks
- Im2Text: Describing Images Using 1 Million Captioned Photographs
- Linking Image and Text with 2-Way Nets
- Dual Attention Networks for Multimodal Reasoning and Matching
- Google’s Multilingual Neural Machine Translation System: Enabling Zero-Shot Translation
- Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models
- Dual-path Convolutional Image-Text Embeddings with Instance Loss
- A Multiscale Visualization of Attention in the Transformer Model
- BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
- Look, Imagine and Match: Improving Textual-Visual Cross-Modal Retrieval with Generative Models
- VisualBERT: A Simple and Performant Baseline for Vision and Language
- Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training
- VL-BERT: Pre-training of Generic Visual-Linguistic Representations
- LXMERT: Learning Cross-Modality Encoder Representations from Transformers
- ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks
- Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks
- ImageBERT: Cross-modal Pre-training with Large-scale Weak-supervised Image-Text Data
- Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks
- IMRAM: Iterative Matching With Recurrent Attention Memory for Cross-Modal Image-Text Retrieval
- Context-Aware Attention Network for Image-Text Retrieval
Cited by
- Deep Supervised Dual Cycle Adversarial Network for Cross-Modal Retrieval
- Contrastive Label Correlation Enhanced Unified Hashing Encoder for Cross-modal Retrieval
- Model Cascades for Efficient Image Search
- Cross-Modal Retrieval for Motion and Text via MildTriple Loss
- Partial visual-semantic embedding: Fine-grained outfit image representation with massive volumes of tags via angular-based contrastive learning
- Question-conditioned debiasing with focal visual context fusion for visual question answering
- FashionSAP: Symbols and Attributes Prompt for Fine-Grained Fashion Vision-Language Pre-Training
- All in One: Exploring Unified Vision-Language Tracking with Multi-Modal Alignment
- Towards Unsupervised Referring Expression Comprehension with Visual Semantic Parsing
- Integrating listwise ranking into pairwise-based image-text retrieval
- MiC: Image-text Matching in Circles with cross-modal generative knowledge enhancement
- Fast unsupervised multi-modal hashing based on piecewise learning
- Collaborative group: Composed image retrieval via consensus learning from noisy annotations
- FiCo-ITR: bridging fine-grained and coarse-grained image-text retrieval for comparative performance analysis
- Multimodal Distillation Pre-Training Model for Ultrasound Dynamic Images Annotation
- Cross-Modal Retrieval: A Review of Methodologies, Datasets, and Future Perspectives
- A Novel Cross-Modal Scene Recognition Algorithm Leveraging Semantic Information
- A fine-grained scene retrieval model for narrative images based on multi-view feature fusion and SC-fused re-ranking
- DviT: Debiased variational inference for multi-modal mutual prompt tuning
- InstructSee: Instruction-Aware and Feedback-Driven Multimodal Retrieval with Dynamic Query Generation
Related papers
- The validity of pairwise models in predicting community dynamics
- Comparing Apples and Oranges: Taxonomy and Design of Pairwise Comparisons within Tabular Data
- Non-pairwise Collaborative Filtering
- Resolution of Activity Scheduling Conflicts: Reverse Pairwise Comparison of In-Home and Out-of-Home Activities
- Pairwise semiregular properties on generalized pairwise regular-Lindelof spaces.
- Lotka-Volterra pairwise modeling fails to capture diverse pairwise microbial interactions
- Low-dimensional embedding using adaptively selected ordinal data