Blog

告别冗长 PDF,一文读懂最新顶会与核心期刊的创新价值。

4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding
Ray-Aware Pointer Memory with Adaptive Updates for Streaming 3D Reconstruction
AGPO: Asymmetric Group Policy Optimization for Verifiable Reasoning and Search Ads Relevance at JD
SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation
LLMorphism: When humans come to see themselves as language models
Creative Robot Tool Use by Counterfactual Reasoning
MDN: Parallelizing Stepwise Momentum for Delta Linear Attention
DART: A Vision-Language Foundation Model for Comprehensive Rope Condition Monitoring
OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models
Misaligned by Reward: Socially Undesirable Preferences in LLMs
de Sitter Wavefunction from Quadrangular Polylogarithms: Chain Graphs
CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs
From Chat to Interview: Agentic Requirements Elicitation with an Experience Ontology
WorldJen: An End-to-End Multi-Dimensional Benchmark for Generative Video Models
Model Form Identification in High-Dimensional Functional Linear Regressions
Optimal Transport Audio Distance with Learned Riemannian Ground Metrics
LoopTrap: Termination Poisoning Attacks on LLM Agents
Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency
MotionGRPO: Overcoming Low Intra-Group Diversity in GRPO-Based Egocentric Motion Recovery
Flow Matching with Arbitrary Auxiliary Paths
Sharper Guarantees for Misspecified Kernelized Bandit Optimization
Flow-OPD: On-Policy Distillation for Flow Matching Models
HumanNet: Scaling Human-centric Video Learning to One Million Hours
Learning Visual Feature-Based World Models via Residual Latent Action
Rubric-based On-policy Distillation
LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling
Teaching Language Models to Think in Code
Lectures on optimization
What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion
Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training