CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation Paper • 2609.04083 • Published Sep 3 • 27
GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent Environments Paper • 2609.00048 • Published Aug 30 • 8
Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments Paper • 2608.24099 • Published Aug 25 • 12
Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains Paper • 2608.09873 • Published Aug 10 • 29