Blog

告别冗长 PDF,一文读懂最新顶会与核心期刊的创新价值。

Nucleation of Sachdev-Ye-Kitaev Clusters in One Spatial Dimension
MoRight: Motion Control Done Right
Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning
Visually-Guided Policy Optimization for Multimodal Reasoning
BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning
Tango: Taming Visual Signals for Efficient Video Large Language Models
OpenSpatial: A Principled Data Engine for Empowering Spatial Intelligence
MemCoT: Test-Time Scaling through Memory-Driven Chain-of-Thought
MegaStyle: Constructing Diverse and Scalable Style Dataset via Consistent Text-to-Image Style Mapping
Scalable Neural Decoders for Practical Fault-Tolerant Quantum Computation
Differential Equations for Massive Correlators
$\mathrm{U}(2)$ Chern-Simons-Ginzburg-Landau Theory of Fractional Quantum Hall Hierarchies
GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling
RewardFlow: Generate Images by Optimizing What You Reward
Mesoscopic transport in a Chern mosaic
ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models
RIRF: Reasoning Image Restoration Framework
Tidal Response of Compact Objects
2D or 3D: Who Governs Salience in VLA Models? -- Tri-Stage Token Pruning Framework with Modality Salience Awareness
A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model
FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios
ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning
FIT: A Large-Scale Dataset for Fit-Aware Virtual Try-On
Lighting-grounded Video Generation with Renderer-based Agent Reasoning
Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing
Fail2Drive: Benchmarking Closed-Loop Driving Generalization
Towards Identification and Intervention of Safety-Critical Parameters in Large Language Models
EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks
Large Language Models Generate Harmful Content Using a Distinct, Unified Mechanism