Blog

No more endless PDFs. Discover the core value of the latest top-tier research in one article.

Generalization at the Edge of Stability
SAW-INT4: System-Aware 4-Bit KV-Cache Quantization for Real-World LLM Serving
The Accrual Anomaly: Risk or Mispricing?
Arbitrary_Lagrangian-Eulerian_and_Fluid-Structure Interaction Numerical Simulation (Benson)
Probabilistic Guarantees for Reducing Contextual Hallucinations in LLMs
Trusting Your Evidence: Hallucinate Less with Context-aware Decoding
Large Language Models as Nondeterministic Causal Models
SAHM: A Benchmark for Arabic Financial and Shari'ah-Compliant Reasoning
Rethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capability
Topology optimization method to devise liquid-cooling plate for managing thermal field of a large-sized lithium-ion battery
Scaling Self-Play with Self-Guidance
Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL
FASTER: Value-Guided Sampling for Fast RL
Synthesizing Multi-Agent Harnesses for Vulnerability Discovery
Visually-Guided Policy Optimization for Multimodal Reasoning
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
Stable-RAG: Mitigating Retrieval-Permutation-Induced Hallucinations in Retrieval-Augmented Generation
LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model
Stream-CQSA: Avoiding Out-of-Memory in Attention Computation via Flexible Workload Scheduling
Generative AI and English language teaching: A global Englishes perspective
SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding
From Research Question to Scientific Workflow: Leveraging Agentic AI for Science Automation
LLM Reasoning Is Latent, Not the Chain of Thought
SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents
LiveResearchBench: A Live Benchmark for User-Centric Deep Research in the Wild
OmniReason: A Temporal-Guided Vision-Language-Action Framework for Autonomous Driving
The Impact of Off-Policy Training Data on Probe Generalisation
Parallel Test-Time Scaling for Latent Reasoning Models
Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence