VLX-Go: Vision-Language Short-Horizon Waypoint Prediction for Embodied Navigation
• 12
Multimodal AI, VLM, VLA, VAM, etc
TRACE: Temporal Audit and Condition-aware Evaluation of Streaming Video Understanding
Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models