Repository for awesome spatial/visual reasoning MLLMs. (focus more on embodied applications)
- [arxiv 2506] VGR: Visual Grounded Reasoning [Datasets]
- [arxiv 2505] Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning [Code]
- [arxiv 2505] Active-o3 : Empowering Multimodal Large Language Models with Active Perception via GRPO [Code]
- [arxiv 2505] One RL to See Them All: Visual Triple Unified Reinforcement Learning [Code] [Dataset]
- [arxiv 2505] DeepEyes: Incentivizing βThinking with Imagesβ via Reinforcement Learning [Code] [Dataset]
- [arxiv 2505] R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO [Code]
- [arxiv 2505] Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models [Code] [Datasets]
- [arxiv 2505] Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning [Datasets] [Code]
- [arxiv 2505] VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction [Code]
- [arxiv 2025] G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning [Code]
- [arxiv 2505] SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward [Code] [Dataset]
- [arxiv 2505] VisionReasoner: Unified Visual Perception and Reasoning via Reinforcement Learning [Code] [Dataset]
- [arxiv 2505] GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning [Code]
- [arxiv 2505] Multi-SpatialMLLM Multi-Frame Spatial Understanding with Multi-Modal Large Language Models [Code]
- [arxiv 2505] GRIT: Teaching MLLMs to Think with Images [Code]
- [arxiv 2505] Visual Agentic Reinforcement Fine-Tuning [Code] [Dataset]
- [arxiv 2505] OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning [Code] [Dataset]
- [arxiv 2504] Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning [Code]
- [arxiv 2504] SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM [HuggingFace]
- [arxiv 2504] Perception-R1: Pioneering Perception Policy with Reinforcement Learning [Code] [Dataset]
- [arxiv 2504] SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement [Code] [Datasets]
- [arxiv 2504] VLM-R1: A stable and generalizable R1-style Large Vision-Language Model [Code] [Dataset]
- [arxiv 2504] VLAA-Thinking: SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models [Code] [Dataset]
- [arxiv 2504] MAYE: Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme [Code] [Dataset]
- [arxiv 2504] R1-SGG: Compile Scene Graphs with Reinforcement Learning [Code]
- [arxiv 2504] NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation [Code] [Datasets]
- [arxiv 2504] VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning [Code] [Dataset]
- [arxiv 2503] Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning [Code] [Dataset]
- [arxiv 2503] MM-Eureka: Exploring Visual Aha Moment with Rule-based Large-scale Reinforcement Learning [Code] [Dataset]
- [arxiv 2503] Visual-RFT: Visual Reinforcement Fine-Tuning [Code] [Datasets]
- [arxiv 2503] OpenVLThinker: An Early Exploration to Vision-Language Reasoning via Iterative Self-Improvement [Code]
- [arxiv 2503] Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning [Code] [Datasets]
- [arxiv 2503] R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization [Code]
- [arxiv 2503] Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought [Code]
- [arxiv 2503] R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization [Code] [Dataset]
- [arxiv 2503, CVPR'25] CoSpace: Benchmarking Continuous Space Perception Ability for Vision-Language Models [Code]
- [arxiv 2503]VisualPRM: An Effective Process Reward Model for Multimodal Reasoning [Code] [Dataset]
- [arxiv 2503] LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL [Code]
- [arxiv 2503] Curr-ReFT: Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning [Code] [Dataset]
- [arxiv 2503] Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models [Code]
- [arxiv 2502, NAACL'25 findings] Mitigating Hallucinations in Multimodal Spatial Relations through Constraint-Aware Prompting [Code]
- [arxiv 2502] VADAR: Visual Agentic AI for Spatial Reasoning with a Dynamic API [Code] [Dataset]
- [arxiv 2502] Introducing Visual Perception Token into Multimodal Large Language Model [Code]
- [arxiv 2501] Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search [Code]
- [arxiv 2501] Virgo: A Preliminary Exploration on Reproducing o1-like MLLM [Code]
- [arxiv 2412, CVPR'25] Perception Tokens Enhance Visual Reasoning in Multimodal Language Models [Code]
- [arxiv 2411] Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models [Code]
- [arxiv 2410] Euclid: Supercharging Multimodal LLMs with Synthetic High-Fidelity Visual Descriptions [Code] [Dataset]
- [arxiv 2410, ICLR'25 Oral] Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities [Code] [Dataset]
- [arxiv 2406, ICRA'25] SpatialBot: Precise Spatial Understanding with Vision Language Models [Code] [Dataset]
- [arxiv 2406, NIPS'24] SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models [Code] [Dataset]
- [NIPS'24] Right this way: Can VLMs Guide Us to See More to Answer Questions? [Code] [Dataset]
- [arxiv 2405, NAACL'25 main] VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models [Code] [Dataset]
- [arxiv 2403] Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models [Code]
- [arxiv 2401,CVPR'24 main] SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities [Code]
- [ACM MM'24] LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description [Code] [Dataset]
- [arxiv 2505] Time-R1: Towards Comprehensive Temporal Reasoning in LLMs [Code] [Dataset]
- [arxiv 2505] SpaceR: Reinforcing MLLMs in Video Spatial Reasoning [Code] [Dataset]
- [arxiv 2504] TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning [Code]
- [arxiv 2504] VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning [Code]
- [arxiv 2504] Spatial-R1: Enhancing MLLMs in Video Spatial Reasoning [Code]
- [arxiv 2504] R1-Zero-VSI: Improved Visual-Spatial Reasoning via R1-Zero-Like Training [Code]
- [arxiv 2503] SEED-Bench-R1: Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1 [Code] [Dataset]
- [arxiv 2503] Video-R1: Reinforcing Video Reasoning in MLLMs [Code] [Dataset]
- [arxiv 2503] TimeZero: Temporal Video Grounding with Reasoning-Guided LVLM [Code]
- [arxiv 2412, CVPR'25] Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding [Code] [Dataset]
- [arxiv 2506] Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning [Code]
- [arxiv 2506] Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces [Code will be released soon]
- [arxiv 2505] Learning 3D Persistent Embodied World Models
- [arxiv 2505] ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge [Code will be released soon]
- [arxiv 2505] Agentic Robot: A Brain-Inspired Framework for Vision-Language-Action Models in Embodied Agents [Code will be released soon]
- [arxiv 2505] InSpire: Vision-Language-Action Models with Intrinsic Spatial Reasoning [Code]
- [arxiv 2505] From Grounding to Manipulation: Case Studies of Foundation Model Integration in Embodied Robotic Systems [Code will be released soon]
- [arxiv 2505] OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning [Code] [Dataset]
- [arxiv 2505] VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning [Code]
- [arxiv 2505] AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
- [arxiv 2505] SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning [Code] [Dataset]
- [arxiv 2504, CVPR'25] InteractVLM: 3D Interaction Reasoning from 2D Foundational Models [Code] [Dataset]
- [arxiv 2504] Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning [Code]
- [arxiv 2504, CVPR'25] RoboGround: Robotic Manipulation with Grounded Vision-Language Priors [Code] [Dataset]
- [arxiv 2504] SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning [Code]
- [arxiv 2504] RoboAct-CLIP: Video-Driven Pre-training of Atomic Action Understanding for Robotics
- [arxiv 2503] PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability [Code] [Dataset]
- [arxiv 2503, CVPR'25] CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models [Code will be releasd soon]
- [arxiv 2503] Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks [Code] [Dataset]
- [arxiv 2503] LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning? [Code] [Dataset]
- [arxiv 2503] MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the Metaverse [Code] [Dataset]
- [arxiv 2503] Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning [Code] [Dataset]
- [arxiv 2502, CVPR'25] RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete [Code]
- [arxiv 2502, ICRA'25] A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards [Code]
- [ICRA'25] UAD: Unsupervised Affordance Distillation for Generalization in Robotic Manipulation [Code]
- [arxiv 2502] ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy [Code]
- [arxiv 2502] SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation [Code]
- [arxiv 2502] Video2Policy: Scaling up Manipulation Tasks in Simulation through Internet Videos
- [arxiv 2502, ICLR'25] Predicate Hierarchies Improve Few-Shot State Classification [Code]
- [arxiv 2501, RSS'25] SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Models [Code]
- [ICLR'25] Vision Language Models are In-Context Value Learners [Code will be released soon]
- [CVPR'24] ManipLLM: Embodied Multimodal Large Language Model for Object-Centric Robotic Manipulation [Code]
- [arxiv 2412] RoboMatrix: A Skill-centric Hierarchical Framework for Scalable Robot Task Planning and Execution in Open-World [Code] [Dataset]
- [arxiv 2412, RSS'25] NaVILA: Legged Robot Vision-Language-Action Model for Navigation [Code]
- [arxiv 2412] Enhancing Multi-Robot Semantic Navigation Through Multimodal Chain-of-Thought Score Collaboration [Code]
- [arxiv 2412] Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection [Code will be released soon]
- [arxiv 2412, CVPR'25] 3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning [Code]
- [CoRL'24 LEAP workshop] SkillWrapper: Autonomously Learning Interpretable Skill Abstractions with Foundation Models [Code]
- [arxiv 2411, CVPR'25 Oral] RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics [Code] [Dataset]
- [arxiv 2410,CoRL'24] Scaling Robot Policy Learning via Zero-Shot Labeling with Foundation Models [Code] [Dataset]
- [arxiv 2410, ICLR'25] AHA: A Vision-Language-Model for Detecting and Reasoning over Failures in Robotic Manipulation [Code]
- [arxiv 2409, RAL'25] MotIF: Motion Instruction Fine-tuning [Code]
- [CVPR'25 Highlight] OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints [Code will be released soon]
- [arxiv 2407, CoRL'24] Robotic Control via Embodied Chain-of-Thought Reasoning [Code]
- [arxiv 2406, CoRL'24] RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics [Code] [Dataset]
- [arxiv 2406, EMNLP'24 main] TopViewRS: Vision-Language Models as Top-View Spatial Reasoners [Code] [Dataset]
- [arxiv 2406, ICLR'25] LLaRA: Supercharging Robot Learning Data for Vision-Language Policy [Code]
- [arxiv 2405] ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation [Code]
- [arxiv 2403, NIPS'24] SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors [Code]
- [arxiv 2402, COLING'24 main] Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models [Code]
- [arxiv 2305, NIPS'23 Spotlight] EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought [Code]
- [CoRL'24] ThinkGrasp: A Vision-Language System for Strategic Part Grasping in Clutter [Code]
- [RAL'24] GPT-4V(ision) for Robotics: Multimodal Task Planning From Human Demonstration
- [NIPS'24 Spotlight] ICAL: VLM Agents Generate Their Own Memories: Distilling Experience into Embodied Programs of Thought [Code]
- SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning
- Memory-Driven Multimodal Chain of Thought for Embodied Long-Horizon Task Planning
- [arxiv 2306,CoRL'23] REFLECT: Summarizing Robot Experiences for Failure Explanation and Correction [Code] [Dataset]
- [arxiv 2505] Omni-R1 (ZJU): Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration [Code][]
- [arxiv 2505] Omni-R1 (MIT): Do You Really Need Audio to Fine-Tune Your Audio LLM?
- [arxiv 2505] EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning [Dataset] [Code]
- [arxiv 2504] SARI: Structured Audio Reasoning via Curriculum-Guided Reinforcement Learning
- [arxiv 2503] R1-AQA: Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering [Code]
- [arxiv 2503] Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models [Code]
- [arxiv 2503] R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning [Code]
- [arxiv 2402, ICML'24] BAT: Learning to Reason about Spatial Sounds with Large Language Models [Code] [Datasets]
- [arxiv 2505] URSA: Understanding and Verifying Chain-of-thought Reasoning in Multimodal Mathematics [Code] [Datasets]
- [arxiv 2403, COLM'24] How Far Are We from Intelligent Visual Deductive Reasoning? [Code]
- [arxiv 2505] Web-Shepherd: Advancing PRMs for Reinforcing Web Agents [Code] [Datasets]
- [arxiv 2505] ARPO: End-to-End Policy Optimization for GUI Agents with Experience Replay [Code]
- [arxiv 2505] GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents [Code]
- [arxiv 2504] WebThinker: Empowering Large Reasoning Models with Deep Research Capability [Code] [Dataset]
- [arxiv 2504] InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners [Code]
- [arxiv 2504] GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents [Dataset] [Code]
- [arxiv 2503] Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models [Code]
- [arxiv 2502] MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning [Code]
- [EMNLP'24 main] MedCoT: Medical Chain of Thought via Hierarchical Expert [Code]
- [arxiv 2505] UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning [Code] [Dataset]
- [arxiv 2504] CrowdVLM-R1: Expanding R1 Ability to Vision Language Model for Crowd Counting using Fuzzy Group Relative Policy Reward [Code] [Dataset]
- [arxiv 2503] Integrating Chain-of-Thought for Multimodal Alignment: A Study on 3D Vision-Language Learning [Dataset]
- [arxiv 2502, CVPR'25 Highlight] Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models [Code]
- [arxiv 2503] Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement [Code]
- [arxiv 2403, ECCV'24] DetToolChain: A New Prompting Paradigm to Unleash Detection Ability of MLLM [Code]
- [arxiv 2403, ECCV'24] Agent3D-Zero: An Agent for Zero-shot 3D Understanding
- [arxiv 2505] Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning [Code]
- [arxiv 2505] UnifiedReward-Think: Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning [Code] [Datasets]
- [arxiv 2505] R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning [Code] [Dataset]
- [arxiv 2505] ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making
- [arxiv 2505] Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets [Dataset]
- [arxiv 2505] RoboFAC: A Comprehensive Framework for Robotic Failure Analysis and Correction [Code]
- [arxiv 2505] SpatialScore: Towards Unified Evaluation for Multimodal Spatial Understanding [Code]
- [arxiv 2505] EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video [Dataset]
- [arxiv 2505] PhyX: Does Your Model Have the "Wits" for Physical Reasoning? [Code] [Dataset]
- [arxiv 2505] ReasonMap: Can MLLMs Guide Me Home? A Benchmark Study on Fine-Grained Visual Reasoning from Transit Maps [Code] [Dataset]
- [arxiv 2504] VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models [Dataset] [Code]
- [arxiv 2504] Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark [Dataset] [Code]
- [arxiv 2504] VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning [Dataset] [Code]
- [arxiv 2504] MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models [Code]
- [arxiv 2504] Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs [Dataset] [Code]
- [arxiv 2503] Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models [Code]
- [arxiv 2503] STI-Bench: Are MLLMs Ready for Precise Spatial-Temporal World Understanding? [Dataset] [Code]
- [arxiv 2503] Open3DVQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open Space [Code]
- [arxiv 2503] Gemini Robotics: Bringing AI into the Physical World (Embodied Reasoning QA Evaluation Dataset) [Code]
- [arxiv 2503] V1-33K: Toward Multimodal Reasoning by Designing Auxiliary Tasks [Dataset] [Code]
- [arxiv 2502] Spatial457: A Diagnostic Benchmark for 6D Spatial Reasoning of Large Multimodal Models [Dataset] [Code]
- [arxiv 2502] MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models [Dataset] [Code]
- [arxiv 2502] MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency [Dataset] [Code]
- [arxiv 2502] ZeroBench: An Impossible* Visual Benchmark for Contemporary Large Multimodal Models [Dataset] [Code]
- [arxiv 2502] HumanEval-V: Benchmarking High-Level Visual Reasoning with Complex Diagrams in Coding Tasks [Dataset] [Code]
- [arxiv 2501] EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents [Dataset] [Code]
- [ICLR 2024 & ECCV 2024] The All-Seeing Projects: Towards Panoptic Visual Recognition&Understanding and General Relation Comprehension of the Open World [Code]
- [arxiv 2411, EMNLP'24 main] Spatial-MM: An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models [Code]
- [arxiv 2411] GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks [Code]
- [arxiv 2412] Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces [Dataset]
- [arxiv 2409] FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension [Code]
- [arxiv 2306] LIBERO:Benchmarking Knowledge Transfer for Lifelong Robot Learning [Code]
- [RAL'22 ] CALVIN: A benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks [Code]
- [arxiv 2210, ICML'23] VIMA: General Robot Manipulation with Multimodal Prompts [Dataset] [Code]
- Maniskill [Code]
- Issac Lab/Gym/Sim [Code]
- SimplerEnv [Code]
- Roboverse [code]
- Bullet Physics SDK [code]
- Genesis [Code]
- RoboTwin [Code]
- RLBench [Code]
- OmniGibson [Document]
- AI2-THOR [Link]
- Legent [code]
- Gazebo [Link]
- CoppeliaSim (formerly known as V-REP) [Link]
- Qwen2.5-VL [Code]
- Bagel [Code]
- BLIP3-o [Code]
- Janus-Series: Unified Multimodal Understanding and Generation Models [Code]
- Kimi-VL [Code]
- InternVL3 [code]
- Bytedance ReFT
- Kimi-K1.5
- DeepSeek-R1
- [arxiv 2505, CVPR'25 highlight] SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models
- [ICLR'25] MLLM as Retriever: Interactively Learning Multimodal Retrieval for Embodied Agents [Code will be released soon]
- [ICLR'25] Chain-of-region: Visual Language Models Need Details for Diagram Analysis
- [arxiv 2505, ICLR'25] Chain-of-Focus Prompting: Leveraging Sequential Visual Cues to Prompt Large Autoregressive Vision Models [Code will be released soon]
- [arxiv 2505] 3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model [Code will be released soon]
- [arxiv 2505] PlaceIt3D: Language-Guided Object Placement in Real 3D Scenes [Code will be released soon]
- [arxiv 2505] WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning [Code will be released soon]
- [arxiv 2505] VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank [Code will be released soon]
- [arxiv 2505] Patho-R1: A Multimodal Reinforcement Learning-Based Pathology Expert Reasoner [Code will be released soon]
- [arxiv 2505] STAR-R1: Spacial TrAnsformation Reasoning by Reinforcing Multimodal LLMs [Code will be released soon]
- [arxiv 2505] Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning [Code will be released soon]
- [arxiv 2505] R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO [Code will be released soon]
- [arxiv 2505] Chain-of-Focus: Adaptive Visual Search and Zooming for Multimodal Reasoning via RL [Code will be released soon]
- [arxiv 2505] Visual Planning: Letβs Think Only with Images [Code will be released soon]
- [arxiv 2505] X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains [Code will be released soon]
- [arxiv 2505] ManipBench: Benchmarking Vision-Language Models for Low-Level Robot Manipulation [Code will be released soon]
- [arxiv 2504, ICRA'25] Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models [Code will be released soon]
- [arxiv 2504] InteractVLM: 3D Interaction Reasoning from 2D Foundational Models [Code will be released soon]
- [arxiv 2504] Fast-Slow Thinking for Large Vision-Language Model Reasoning [Code will be released soon]
- [arxiv 2504] Relation-R1: Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relational Comprehension [Code will be released soon]
- [arxiv 2504] Perspective-Aware Reasoning in Vision-Language Models via Mental Imagery Simulation [Code will be released soon]
- [arxiv 2504] Mixed Signals: Decoding VLMs' Reasoning and Underlying Bias in Vision-Language Conflict [Code will be released soon]
- [arxiv 2504] KeyMPs: One-Shot Vision-Language Guided Motion Generation by Sequencing DMPs for Occlusion-Rich Tasks
- [arxiv 2503] Can Large Vision Language Models Read Maps Like a Human? [Code will be released soon]
- [arxiv 2503] ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models [Code will be released soon]
- [arxiv 2503] Q-Insight: Understanding Image Quality via Visual Reinforcement Learning [Code will be released soon]
- [arxiv 2503] VisualThinker-R1-Zero: R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model [Code will be released soon]
- [arxiv 2503] Free-form language-based robotic reasoning and grasping [Code will be released soon]
- [arxiv 2502] NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning [Code will be released soon]
- [arxiv 2412] SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models [Code will be released soon]
- [arxiv 2410] Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
- [arxiv 2406] RoboGolf: Mastering Real-World Minigolf with a Reflective Multi-Modality Vision-Language Model [Code will be released soon]
- [arxiv 2402] PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs [Code will be released soon]
- [arxiv 2412] Video LLMs for Temporal Reasoning in Long Videos
- [arxiv 2412] Improving Vision-Language-Action Models via Chain-of-Affordance [Code will be released soon]
- [arxiv 2411] Learning from Feedback: Semantic Enhancement for Object SLAM Using Foundation Models [Code will be released soon]
- [arxiv 2312] Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models [Code will be released soon]
- [ACM MMβ24] RAG-Guided Large Language Models for Visual Spatial Description with Adaptive Hallucination Corrector
- [ICLR'25 workshop] Evaluating Multi-modal Language Models Through Concept Hacking
- R1-V π»
- Multimodal Open R1 π»
- MMR1 π»
- R1-Multimodal-Journey π»
- R1-Vision π»
- Ocean-R1 π»
- R1V-Free π»
- SeekWorld π»
- R1-Track π»
- https://github.com/Sun-Haoyuan23/Awesome-RL-based-Reasoning-MLLMs
- https://github.com/yaotingwangofficial/Awesome-MCoT
- https://github.com/jonyzhang2023/awesome-embodied-vla-va-vln
- https://modelscope.cn/studios/AI-ModelScope/awesome-reasoning
- https://github.com/Songwxuan/Embodied-AI-Paper-TopConf
- https://github.com/HCPLab-SYSU/Embodied_AI_Paper_List
- https://github.com/zubair-irshad/Awesome-Robotics-3D
- https://github.com/LightChen233/Awesome-Long-Chain-of-Thought-Reasoning
- https://github.com/NishilBalar/Awesome-LVLM-Hallucination
- https://github.com/zhengxuJosh/Awesome-RAG-Vision
- https://github.com/BioRAILab/Awesome-Neuroscience-Agent-Reasoning
- https://github.com/BioRAILab/Neural-Brain-for-Embodied-Agents
If you find this repository useful for your research and applications, please star us and consider citing:
@misc{Tang2025Awesome-spatial-visual-reasoning-MLLMs,
title={Awesome-spatial-visual-reasoning-MLLMs},
author={Jing Tang},
year={2025},
howpublished={\url{https://github.com/vaew/Awesome-spatial-visual-reasoning-MLLMs}},
note={Github Repository},
}
