The Research Desk.

The most upvoted and starred AI research crossing the community today.

Last Brew Time: Jul 20, 2026, 10:43 AM PT

X.com Research Buzz

NLP
CitySim: Modeling Urban Behaviors and City Dynamics with Large-Scale LLM-Driven Agent Simulation
X.com
2751

CitySim: Modeling Urban Behaviors and City Dynamics with Large-Scale LLM-Driven Agent Simulation

Nicolas Bougie, Narimasa Watanabe

Woven by Toyota

AlphaXiv Trending

Reinforcement Learning
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
AlphaXiv
137

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

JW, Jinyang Wu, Shuo Yang, Zhengxi Lu

Tongji University, Tsinghua University

Computer Vision
Video = World + Event Stream
AlphaXiv
66

Video = World + Event Stream

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi

Alibaba Group

Robotics
RoboTTT: Context Scaling for Robot Policies
AlphaXiv
64

RoboTTT: Context Scaling for Robot Policies

Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng

NVIDIA, Stanford University, The University of Texas at Austin, research.nvidia.com/labs/gear/robottt

Reinforcement Learning
On-Policy Delta Distillation
AlphaXiv
60

On-Policy Delta Distillation

Byeongho Heo, Jaehui Hwang, Sangdoo Yun

NAVER AI Lab

NLP
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
AlphaXiv
52

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

Xinhao Li, Yuhan Zhu, Xiangyu Zeng

Nanjing University, Shanghai AI Laboratory, Nanyang Technological University, Peking University

Reinforcement Learning
TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
AlphaXiv
47

TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents

Leitian Tao, Baolin Peng, Wenlin Yao

University of Wisconsin–Madison, Microsoft Research

HuggingFace Daily Papers

Reinforcement Learning
RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources
HuggingFace
102

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng

Microsoft Research

Reinforcement Learning
Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization
HuggingFace
8

Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization

Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai

Machine Learning
REBASE: Reference-Background Subspace Elimination for Training-Free In-Context Segmentation
HuggingFace
6

REBASE: Reference-Background Subspace Elimination for Training-Free In-Context Segmentation

Mantha Sai Gopal, Jaison Saji Chacko, Harsh Nandwana, Sandesh Hegde, Debarshi Banerjee

Reinforcement Learning
Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies
HuggingFace
2

Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies

Barkha Rani

Computer Vision
See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models
HuggingFace
2

See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models

Byungkun Lee, Dongyoon Hwang, Dongjin Kim, Hojoon Lee, Minho Park

KAIST AI

Reinforcement Learning
Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning
HuggingFace
2

Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning

Vladislav Beliaev