The Research Desk.

The most upvoted and starred AI research crossing the community today.

Last Brew Time: Sep 6, 2026, 10:46 AM PT

AlphaXiv Trending

Machine Learning
Rethinking On-Policy Distillation of Large Language Models II: One Training Example
AlphaXiv
81

Rethinking On-Policy Distillation of Large Language Models II: One Training Example

Affiliation: University of Chinese Academy of Sciences, Affiliation: Tsinghua University, Affiliation: Northeastern University, Affiliation: University of Illinois Urbana-Champaign, University of Chinese Academy of Sciences

NLP
Unlocking Lossless Speedups in LLMs via Discrete Diffusion
AlphaXiv
44

Unlocking Lossless Speedups in LLMs via Discrete Diffusion

AlphaXiv
39

Formalizing Fermat's Last Theorem

Reinforcement Learning
Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
AlphaXiv
36

Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments

Affiliation: Qwen Team, Alibaba Group Tsinghua University, Affiliation: Qwen Team, Alibaba Group Tsinghua University Affiliation: Corresponding authors, Qwen Team, Alibaba Group Tsinghua University

NLP
Large-Language Models as a Cognitive Virus
AlphaXiv
18

Large-Language Models as a Cognitive Virus

Affiliation: Complex Systems Lab, Universitat Pompeu Fabra (MELIS), Dr. Aiguader 88, 08003 Barcelona, Spain, Affiliation: Santa Fe Institute, 1399 Hyde Park Road, Santa Fe NM, United States, Affiliation: Barcelona Computational Foundation (BCOM) and Neuroelectrics, Barcelona, Spain, Affiliation: Okinawa Institute of Science and Technology Graduate University, Onna, 904-0495, Japan, Affiliation: Padua Center for Network Medicine, Via Marzolo 8, 35131 Padova, Italy

HuggingFace Daily Papers

Robotics
RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning
HuggingFace
115

RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning

Howard Qian, Yiting Chen, Yunfei Xie, Kejia Ren, Podshara Chanrungmaneekul

Rice RobotPI Lab

Reasoning
Last Translation Benchmark
HuggingFace
27

Last Translation Benchmark

Vilém Zouhar, Niyati Bafna, Mukund Choudhary, Maike Züfle, Sara Rajaee

Machine Learning
DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training
HuggingFace
23

DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

Shubham Gandhi, Saurabh Goyal, Kiran Kate, Yara Rizk

IBM Research

Reinforcement Learning
VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement
HuggingFace
12

VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement

Wenzhuo Xu, Yuchen Zhu, Chongjian Ge, Xuan Shen, Jing Shi

Speech Audio
A Common Measure of Communication for Speech Brain-Computer Interfaces
HuggingFace
10

A Common Measure of Communication for Speech Brain-Computer Interfaces

Dulhan Jayalath, Benjamin Ballyk, Oiwi Parker Jones

Parker Jones Neural Processing Lab (PNPL)

Ershiyidian
Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space
HuggingFace
9

Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space

Qiancheng Zhou, Ruizhe Li

University of Birmingham