Blog

告别冗长 PDF,一文读懂最新顶会与核心期刊的创新价值。

Lensing in the Blue III: Weak Lensing Shape Catalogs of 30 Merging Galaxy Clusters
SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing
Mathematical Foundations of Deep Learning
RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models
LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs
Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer
Matryoshka Gaussian Splatting
Foundations of Schrödinger Bridges for Generative Modeling
OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation
Meta-TTRL: A Metacognitive Framework for Self-Improving Test-Time Reinforcement Learning in Unified Multimodal Models
Video Understanding: From Geometry and Semantics to Unified Models
EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing
DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising
vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models
MeMix: Writing Less, Remembering More for Streaming 3D Reconstruction
Motion-o: Trajectory-Grounded Video Reasoning
Kimodo: Scaling Controllable Human Motion Generation
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation
Do VLMs Need Vision Transformers? Evaluating State Space Models as Vision Encoders
Points-to-3D: Structure-Aware 3D Generation with Point Cloud Priors
TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation
Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models
SOL-ExecBench: Speed-of-Light Benchmarking for Real-World GPU Kernels Against Hardware Limits
Data-efficient pre-training by scaling synthetic megadocs
The Neuroscience of Transformers
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
How LLMs Distort Our Written Language
CodeScout: An Effective Recipe for Reinforcement Learning of Code Search Agents
Learning to Self-Evolve