Object-Based Reasoning in VQA
Explore this paper's citation graph
- Type
- preprint
- Published
- 2018-01-29
- Cited by
- 34
- References
- 52
- Access
- Open access
- OpenAlex
- https://openalex.org/W2786686366
- Semantic Scholar
- https://api.semanticscholar.org/CorpusID:13682544
Keywords
Computer science, Task (project management), Artificial intelligence, Question answering, Object (grammar)
References
- Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks
- Efficient Estimation of Word Representations in Vector Space
- Long Short-Term Memory
- A Multi-World Approach to Question Answering about Real-World Scenes based on Uncertain Input
- Learning Phrase Representations using RNN Encoder–Decoder for Statistical Machine Translation
- ImageNet classification with deep convolutional neural networks
- Ask Me Anything: Free-Form Visual Question Answering Based on Knowledge from External Sources
- Where to Look: Focus Regions for Visual Question Answering
- Region-Based Convolutional Networks for Accurate Object Detection and Segmentation
- Deep Residual Learning for Image Recognition
- Visual Madlibs: Fill in the Blank Description Generation and Question Answering
- GloVe: Global Vectors for Word Representation
- Deep Compositional Question Answering with Neural Module Networks
- TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems
- Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations
- Adaptive Computation Time for Recurrent Neural Networks
- Ask Your Neurons: A Deep Learning Approach to Visual Question Answering
- Image Question Answering: A Visual Semantic Embedding Model and a New Dataset
- Neural Module Networks
- Hierarchical Question-Image Co-Attention for Visual Question Answering
Cited by
- Understand, Compose and Respond - Answering Visual Questions by a Composition of Abstract Procedures
- VQA With No Questions-Answers Training
- Information fusion in visual question answering: A Survey
- Learning Visual Question Answering by Bootstrapping Hard Attention
- Detecting Anomalies in Image Classification by Means of Semantic Relationships
- Deep Set Prediction Networks
- PyTorchPipe: a framework for rapid prototyping of pipelines combining language and vision
- Transfer Learning in Visual and Relational Reasoning
- Stochastic Relational Network
- BERT Representations for Video Question Answering
- Set-Structured Latent Representations
- Dynamic Language Binding in Relational Visual Reasoning
- Visual Question Answering on Image Sets
- Object-based attention for spatio-temporal reasoning: Outperforming neuro-symbolic models with flexible distributed architectures
- Object-Centric Representation Learning for Video Question Answering
- Hierarchical Object-oriented Spatio-Temporal Reasoning for Video Question Answering
- A survey of methods, datasets and evaluation metrics for visual question answering
- Research on Visual Question Answering Based on GAT Relational Reasoning
- Video Dialog as Conversation about Objects Living in Space-Time
- A Review on Methods and Applications in Multimodal Deep Learning
Related papers
- CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning
- Long Short-Term Memory
- Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding
- A Focused Dynamic Attention Model for Visual Question Answering
- Multi-Channel Co-Attention Network for Visual Question Answering
- Improving Visual Reasoning Through Semantic Representation
- Reasoning-RCNN: Unifying Adaptive Global Reasoning Into Large-Scale Object Detection