Blog

告别冗长 PDF,一文读懂最新顶会与核心期刊的创新价值。

ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration
Perceptual Flow Network for Visually Grounded Reasoning
Learning to Theorize the World from Observation
Audio-Visual Intelligence in Large Foundation Models
Mix3R: Mixing Feed-forward Reconstruction and Generative 3D Priors for Joint Multi-view Aligned 3D Reconstruction and Pose Estimation
A Benchmark for Interactive World Models with a Unified Action Generation Framework
Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning
Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe
Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs
BifrostUMI: Bridging Robot-Free Demonstrations and Humanoid Whole-Body Manipulation
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
Linearizing Vision Transformer with Test-Time Training
MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model
Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
ProgramBench: Can Language Models Rebuild Programs From Scratch?
From Context to Skills: Can Language Models Learn from Context Skillfully?
Large Language Models are Universal Reasoners for Visual Generation
Model Merging: Foundations and Algorithms
RoboAlign-R1: Distilled Multimodal Reward Alignment for Robot Video World Models
LLM-Emu: Native Runtime Emulation of LLM Inference via Profile-Driven Sampling
Embody4D: A Generalist 4D World Model for Embodied AI
Seeing Realism from Simulation: Efficient Video Transfer for Vision-Language-Action Data Augmentation
AcademiClaw: When Students Set Challenges for AI Agents
Latent Bridge: Feature Delta Prediction for Efficient Dual-System Vision-Language-Action Model Inference
Conditional Diffusion Sampling
Motion-Aware Caching for Efficient Autoregressive Video Generation
Contextual Agentic Memory is a Memo, Not True Memory
Discovering Reinforcement Learning Interfaces with Large Language Models
Lectures on Condensed Mathematics