Sinong (Simon) Zhan
Publications
Mentoring
Blog Posts
CV
Publications
For a detailed full list of my articles, please visit
my Google Scholar profile
.
Preprints
A Unified Framework for Rethinking Policy Divergence Measures in GRPO
Qingyuan Wu, Yuhui Wang,
Simon Sinong Zhan
, Yanning Dai, Shilong Deng, Sarra Habchi, Qi Zhu, Matthias Gallé, Chao Huang
arXiv
Paper
SENTINEL: A Multi-Level Formal Framework for Safety Evaluation of Foundation Model-based Embodied Agents
Simon Sinong Zhan
, Yao Liu, Philip Wang, Zinan Wang, Qineng Wang, Yiyan Peng, Zhian Ruan, Xiangyu Shi, Xinyu Cao, Frank Yang, Kangrui Wang, Huajie Shao, Manling Li, Qi Zhu
arXiv
Paper
Inverse Delayed Reinforcement Learning
Simon Sinong Zhan
*, Qingyuan Wu*, Zhian Ruan, Frank Yang, Philip Wang, Yixuan Wang, Ruochen Jiao, Chao Huang, Qi Zhu (*equal contribution)
arXiv
Paper
2026
Shedding Light on VLN Robustness: A Black-box Framework for Indoor Lighting-based Adversarial Attack
Chenyang Li, Wenbing Tang, Yihao Huang,
Sinong Simon Zhan
, Ming Hu, Xiaojun Jia, Yang Liu
CVPR 2026
Paper
STEP-LLM: Generating CAD STEP Models from Natural Language with Large Language Models
Xiangyu Shi, Junyang Ding, Xu Zhao,
Sinong Zhan
, Payal Mohapatra, Daniel Quispe, Kojo Welbeck, Jian Cao, Wei Chen, Ping Guo, Qi Zhu
DATE 2026
Paper
Code
Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
Weitao Feng, Lixu Wang, Tianyi Wei, Jie Zhang, Chongyang Gao,
Simon Sinong Zhan
, Peizhuo Lv, Wei Dong
CCS 2026
Paper
Project
Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping
Simon Sinong Zhan
, Philip Wang, Qingyuan Wu, Ruochen Jiao, Yixuan Wang, Chao Huang, Qi Zhu (*equal contribution)
L4DC 2026
Paper
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
Simon Sinong Zhan
, Qingyuan Wu, Philip Wang, Frank Yang, Xiangyu Shi, Chao Huang, Qi Zhu
ICLR 2026
Paper
Code
Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning
Yimeng Zhang, Tian Wang, Jiri Gesi, Ziyi Wang, Yuxuan Lu, Jiacheng Lin,
Sinong Zhan
, Vianne Gao, Ruochen Jiao, Junze Liu, Kun Qian, Yuxin Tang, Ran Xue, Houyu Zhang, Qingjun Cui, Yufan Guo, Dakuo Wang
ICLR 2026
Paper
2025
See, Think, Act: Online Shopper Behavior Simulation with VLM Agents
Yimeng Zhang, Jiri Gesi, Ran Xue, Tian Wang, Ziyi Wang, Yuxuan Lu,
Sinong Zhan
, Huimin Zeng, Qingjun Cui, Yufan Guo, Jing Huang, Mubarak Shah, Dakuo Wang
SEA @ NeurIPS 2025
Paper
Directly Forecasting Belief for Reinforcement Learning with Delays
Qingyuan Wu*, Yuhui Wang*,
Simon Sinong Zhan
*, Yixuan Wang, Chung-Wei Lin, Chen Lv, Qi Zhu, Jürgen Schmidhuber, Chao Huang (*equal contribution)
ICML 2025
Paper
2024
Case Study: Runtime Safety Verification of Neural Network Controlled System
Frank Yang,
Simon Sinong Zhan
, Yixuan Wang, Chao Huang, Qi Zhu
RV 2024
Paper
Variational Delayed Policy Optimization
Qingyuan Wu*,
Simon Sinong Zhan
*, Yixuan Wang, Yuhui Wang, Chung-Wei Lin, Chen Lv, Qi Zhu, Chao Huang (*equal contribution)
NeurIPS 2024
Spotlight
Paper
Code
Switching Controller Synthesis for Hybrid Systems Against STL Formulas
Han Su, Shenghua Feng,
Simon Sinong Zhan
, Naijun Zhan
FM 2024
Paper
Kinematics-aware Trajectory Generation and Prediction with Latent SDE
Ruochen Jiao*, Yixuan Wang*, Xiangguo Liu,
Simon Sinong Zhan
, Chao Huang, Qi Zhu (*equal contribution)
IROS 2024
Paper
Boosting Reinforcement Learning with Strongly Delayed Feedback Through Auxiliary Short Delays
Qingyuan Wu,
Simon Sinong Zhan
, Yixuan Wang, Yuhui Wang, Chung-Wei Lin, Chen Lv, Qi Zhu, Jürgen Schmidhuber, Chao Huang
ICML 2024
Paper
Code
State-wise Safe Reinforcement Learning With Pixel Observations
Simon Sinong Zhan
, Yixuan Wang, Qingyuan Wu, Ruochen Jiao, Chao Huang, Qi Zhu
L4DC 2024
Paper
Code
Empowering Autonomous Driving with Large Language Models: A Safety Perspective
Yixuan Wang, Ruochen Jiao,
Simon Zhan
, Chengtian Lang, Chao Huang, Zhaoran Wang, Zhuoran Yang, Qi Zhu
LLMAgent @ ICLR 2024
Paper
2023
Enforcing Hard Constraints with Soft Barriers: Safe Reinforcement Learning in Unknown Stochastic Environments
Yixuan Wang,
Simon Sinong Zhan
, Ruochen Jiao, Zhilu Wang, Wanxin Jin, Zhuoran Yang, Zhaoran Wang, Chao Huang, Qi Zhu
ICML 2023
Paper
Code
Joint Differentiable Optimization and Verification for Certified Reinforcement Learning
Yixuan Wang*,
Simon Sinong Zhan
*, Zhilu Wang, Chao Huang, Zhaoran Wang, Zhuoran Yang, Qi Zhu (*equal contribution)
ICCPS 2023
Paper
Code
2022
MicroFluID - A Reconfigurable RFID Platform for Robust Interaction Sensing Based on Microfluidics
Wei Sun, Yuwen Chen, Yanjun Chen, Xiaopeng Zhang,
Simon Zhan
, Yixin Li, Jiecheng Wu, Teng Han, Haipeng Mi, Jingxian Wang, Feng Tian, Xing-Dong Yang
UbiComp 2022
Paper
Video
2021
RElectrode: A Reconfigurable Electrode For Multi-Purpose Sensing Based on Microfluidics
Wei Sun, Yanjun Chen,
Simon Zhan
, Teng Han, Feng Tian, Hongan Wang, Xing-Dong Yang
CHI 2021
Paper
Video