<!doctype html><html lang="en" class="no-js"><head><meta charset="utf-8"> <!-- begin SEO --><title>Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization - Sinong (Simon) Zhan</title><meta name="description" content="DT-CORL learns delay-robust policies from static, delay-free offline data by jointly optimizing a transformer-based belief model and a constrained policy objective."><meta property="article:published_time" content="2026-01-23T00:00:00+00:00"><link rel="canonical" href="https://simon-zhan.com/publication/2026-iclr-dt-corl.md"> <script type="application/ld+json"> { "@context" : "http://schema.org", "@type" : "Person", "name" : "Simon Zhan", "url" : "https://simon-zhan.com", "sameAs" : null } </script> <!-- end SEO --> <!-- Open Graph protocol data (https://ogp.me/), used by social media --><meta property="og:locale" content="en-US"><meta property="og:site_name" content="Sinong (Simon) Zhan"><meta property="og:title" content="Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization"><meta property="og:type" content="article"><meta property="og:description" name="description" content="DT-CORL learns delay-robust policies from static, delay-free offline data by jointly optimizing a transformer-based belief model and a constrained policy objective."><meta property="og:url" content="https://simon-zhan.com/publication/2026-iclr-dt-corl.md"> <!-- end Open Graph protocol --><link href="https://simon-zhan.com/feed.xml" type="application/atom+xml" rel="alternate" title="Sinong (Simon) Zhan Feed"> <!-- http://t.co/dKP3o1e --><meta name="HandheldFriendly" content="True"><meta name="MobileOptimized" content="320"><meta name="viewport" content="width=device-width, initial-scale=1.0"> <script> document.documentElement.className = document.documentElement.className.replace(/\bno-js\b/g, '') + ' js '; </script> <!-- For all browsers --><link rel="stylesheet" href="https://simon-zhan.com/assets/css/main.css?v=2"><meta http-equiv="cleartype" content="on"> <!-- start custom head snippets --> <!-- Support for Academicons --><link rel="stylesheet" href="https://simon-zhan.com/assets/css/academicons.css"/> <!-- favicon from https://commons.wikimedia.org/wiki/File:OOjs_UI_icon_academic-progressive.svg --><link rel="apple-touch-icon" sizes="180x180" href="https://simon-zhan.com/images/apple-touch-icon-180x180.png"/><link rel="icon" type="image/svg+xml" href="https://simon-zhan.com/images/favicon.svg"/><link rel="icon" type="image/png" href="https://simon-zhan.com/images/favicon-32x32.png" sizes="32x32"/><link rel="icon" type="image/png" href="https://simon-zhan.com/images/favicon-192x192.png" sizes="192x192"/><link rel="manifest" href="https://simon-zhan.com/images/manifest.json"/><link rel="icon" href="/images/favicon.ico"/><meta name="theme-color" content="#ffffff"/> <!-- end custom head snippets --></head><body> <!--[if lt IE 9]><div class="notice--danger align-center" style="margin: 0;">You are using an <strong>outdated</strong> browser. Please <a href="http://browsehappy.com/">upgrade your browser</a> to improve your experience.</div><![endif]--><div class="masthead"><header class="site-header"> <a class="site-header__name" href="https://simon-zhan.com/">Sinong (Simon) Zhan</a><nav class="site-header__nav"> <a href="https://simon-zhan.com/publications/">Publications</a> <a href="https://simon-zhan.com/mentoring/">Mentoring</a> <a href="https://simon-zhan.com/year-archive/">Blog Posts</a> <a href="https://simon-zhan.com/cv/">CV</a></nav></header></div><div id="main" role="main"><article class="page" itemscope itemtype="http://schema.org/CreativeWork"><meta itemprop="headline" content="Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization"><meta itemprop="description" content="DT-CORL learns delay-robust policies from static, delay-free offline data by jointly optimizing a transformer-based belief model and a constrained policy objective."><meta itemprop="datePublished" content="January 23, 2026"><div class="page__inner-wrap"><header><h1 class="page__title" itemprop="headline">Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization</h1><p>Published in <i>ICLR 2026</i>, 2026</p></header><section class="page__content" itemprop="text"><p>Offline–to–online deployment of reinforcement learning (RL) agents often stumbles over two fundamental gaps: (1) the sim-to-real gap, where real-world systems exhibit latency and other physical imperfections not captured in simulation; and (2) the interaction gap, where policies trained purely offline face out-of-distribution (OOD) issues during online execution, as collecting new interaction data is costly or risky. As a result, agents must generalize from static, delay-free datasets to dynamic, delay-prone environments. In this work, we propose DT-CORL(Delay-Transformer belief policy Constrained Offline RL), a novel framework for learning delay-resilient policies solely from static, delay-free offline data. DT-CORL introduces a transformer-based belief model to infer latent states from delayed observations and jointly trains this belief with a constrained policy objective, ensuring that value estimation and belief representation remain aligned throughout learning. Crucially, our method does not require access to delayed transitions during training and outperforms naive history-augmented baselines, SOTA delayed RL methods, and existing belief-based approaches. Empirically, we demonstrate that DT-CORL achieves strong delay-robust generalization across both locomotion and goal-conditioned tasks in the D4RL benchmark under varying delay regimes. Our results highlight that joint belief-policy optimization is essential for bridging the sim-to-real latency gap and achieving stable performance in delayed environments.</p><p><strong>Authors:</strong> Simon Sinong Zhan, Qingyuan Wu, Philip Wang, Frank Yang, Xiangyu Shi, Chao Huang, Qi Zhu</p><div class="citation-section"><h3>Citation</h3><div class="citation-container"> <button class="copy-btn" onclick="copyBibtex()" title="Copy BibTeX to clipboard"> <i class="fas fa-copy"></i> Copy BibTeX </button><pre class="bibtex-code" id="bibtex-content"><code>@article{zhan2025adapting, title={Adapting Offline Reinforcement Learning with Online Delays}, author={Zhan, Simon Sinong and Wu, Qingyuan and Yang, Frank and Shi, Xiangyu and Huang, Chao and Zhu, Qi}, journal={arXiv preprint arXiv:2506.00131}, year={2025} }</code></pre></div></div><div class="download-links"> <a href="https://arxiv.org/pdf/2506.00131" class="btn btn--primary"> <i class="fas fa-file-pdf"></i> Download Paper </a> <a href="https://github.com/SimonZhan-code/DT-CORL" class="btn btn--warning"> <i class="fas fa-code"></i> View Code </a></div></section><footer class="page__meta"></footer><nav class="pagination"> <a href="https://simon-zhan.com/publication/2025-shop-r1-llm-shopping" class="pagination--pager" title="Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning ">Previous</a> <a href="https://simon-zhan.com/publication/2026-l4dc-model-based-irl" class="pagination--pager" title="Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping ">Next</a></nav></div></article></div><script> function copyBibtex() { const bibtexContent = document.getElementById('bibtex-content').innerText; navigator.clipboard.writeText(bibtexContent).then(function() { // Success feedback const btn = document.querySelector('.copy-btn'); const originalText = btn.innerHTML; btn.innerHTML = '<i class="fas fa-check"></i> Copied!'; btn.style.backgroundColor = '#28a745'; setTimeout(function() { btn.innerHTML = originalText; btn.style.backgroundColor = ''; }, 2000); }, function(err) { // Fallback for older browsers const textArea = document.createElement('textarea'); textArea.value = bibtexContent; document.body.appendChild(textArea); textArea.select(); document.execCommand('copy'); document.body.removeChild(textArea); // Success feedback const btn = document.querySelector('.copy-btn'); const originalText = btn.innerHTML; btn.innerHTML = '<i class="fas fa-check"></i> Copied!'; btn.style.backgroundColor = '#28a745'; setTimeout(function() { btn.innerHTML = originalText; btn.style.backgroundColor = ''; }, 2000); }); } </script><div class="page__footer"><footer> <!-- start custom footer snippets --> <a href="/sitemap/">Sitemap</a> <!-- Support for MatJax --> <script defer src="https://cdnjs.cloudflare.com/polyfill/v3/polyfill.min.js?features=es6"></script> <script defer src="https://cdn.jsdelivr.net/npm/mathjax@3/es5/tex-mml-chtml.js" id="MathJax-script"></script> <!-- Support for Plotly --> <script defer src='https://cdnjs.cloudflare.com/ajax/libs/plotly.js/3.0.1/plotly.min.js'></script> <!-- Support for Mermaid --> <script type="module"> import mermaid from 'https://cdn.jsdelivr.net/npm/mermaid@11/dist/mermaid.esm.min.mjs'; mermaid.initialize({startOnLoad:true, theme:'default'}); await mermaid.run({querySelector:'code.language-mermaid'}); </script> <!-- end custom footer snippets --><div class="footer-clean"> &copy; 2026 Sinong (Simon) Zhan &middot; Powered by <a href="https://jekyllrb.com" rel="nofollow">Jekyll</a> &amp; <a href="https://github.com/academicpages/academicpages.github.io">AcademicPages</a> &middot; <a href="https://github.com/SimonZhan-code" aria-label="GitHub"><i class="fab fa-github" aria-hidden="true"></i></a></div></footer></div><script type="module" src="https://simon-zhan.com/assets/js/main.min.js"></script></body></html>
