Blog

告别冗长 PDF,一文读懂最新顶会与核心期刊的创新价值。

Planning from Observation and Interaction
AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation
SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale
Do LLMs Benefit From Their Own Words?
DashengTokenizer: One layer is enough for unified audio understanding and generation
AI Must Embrace Specialization via Superhuman Adaptable Intelligence
OmniTrack: General Motion Tracking via Physics-Consistent Reference
Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
LK Losses: Direct Acceptance Rate Optimization for Speculative Decoding
Accelerating Masked Image Generation by Learning Latent Controlled Dynamics
DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science
Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
Compositional Generalization Requires Linear, Orthogonal Representations in Vision Embedding Models
FAVLA: A Force-Adaptive Fast-Slow VLA model for Contact-Rich Robotic Manipulation
GeoDiff4D: Geometry-Aware Diffusion for 4D Head Avatar Reconstruction
Demystifying Action Space Design for Robotic Manipulation Policies
SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
Toward Guarantees for Clinical Reasoning in Vision Language Models via Formal Verification
HumanOrbit: 3D Human Reconstruction as 360° Orbit Generation
TradeFM: A Generative Foundation Model for Trade-flow and Market Microstructure
Learning Generation Orders for Masked Discrete Diffusion Models via Variational Inference
Learning Accurate Segmentation Purely from Self-Supervision
APPO: Attention-guided Perception Policy Optimization for Video Reasoning
Any Model, Any Place, Any Time: Get Remote Sensing Foundation Model Embeddings On Demand
The Shape of Eccentricity: Rapid Classification of Eccentric Binaries with the Wavelet Scattering Transform
U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
Learning to Reflect and Correct: Towards Better Decoding Trajectories for Large-Scale Generative Recommendation
GRAIL: Post-hoc Compensation by Linear Reconstruction for Compressed Networks