Blog

No more endless PDFs. Discover the core value of the latest top-tier research in one article.

ArtLLM: Generating Articulated Assets via 3D LLM
LaSER: Internalizing Explicit Reasoning into Latent Space for Dense Retrieval
MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine
Recursive Models for Long-Horizon Reasoning
LAD-Drive: Bridging Language and Trajectory with Action-Aware Diffusion Transformers
MicroVerse: A Preliminary Exploration Toward a Micro-World Simulation
RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design
A Unified Explanation for JWST Little Red Dots and High-Redshift Low-Mass Disk-like Galaxies: Prolate Galaxies Viewed End-on vs Side-on
ReloQate: Transient Drift Detection and In-Situ Recalibration in Surface Code Quantum Error Correction
FastLightGen: Fast and Light Video Generation with Fewer Steps and Parameters
Adam Converges Without Any Modification On Update Rules
OnlineX: Unified Online 3D Reconstruction and Understanding with Active-to-Stable State Evolution
Temporal patterns of preferences through Wikipedia editing in different languages
U-VLM: Hierarchical Vision Language Modeling for Report Generation
RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations
EvoX: Meta-Evolution for Automated Discovery
Agentic Code Reasoning
Schwinger--Keldysh formulation of electromagnetic leptogenesis in an EFT framework
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
UniHM: Unified Dexterous Hand Manipulation with Vision Language Model
One-Token Verification for Reasoning Correctness Estimation
MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence
Summer-22B: A Systematic Approach to Dataset Engineering and Training at Scale for Video Foundation Model
CoMoL: Efficient Mixture of LoRA Experts via Dynamic Core Space Merging
Mean-Flow based One-Step Vision-Language-Action
Reasoning Core: A Scalable Procedural Data Generation Suite for Symbolic Pre-training and Post-Training
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
To Use or not to Use Muon: How Simplicity Bias in Optimizers Matters
Understanding the Physics of Key-Value Cache Compression for LLMs through Attention Dynamics
GroupGPT: A Token-efficient and Privacy-preserving Agentic Framework for Multi-User Chat Assistant