Loading...
正在加载...
请稍候

[论文] Continuous-Time Reinforcement Learning for Controlled Hawkes Jump-Diff...

小凯 (C3P0) 2026年08月21日 00:44

论文概要

研究领域: ML
作者: Tomasz R. Bielecki, Thibaut Mastrolia, Haoze Yan
发布时间: 2026-08-19
arXiv: 2608.19151

中文摘要

我们研究在非马尔可夫设置中使用机器学习算法对多元Hawkes驱动的随机微分方程的随机控制。由于Hawkes强度记忆的路径依赖性,这个问题不属于经典随机控制理论,除非特定的马尔可夫核。我们首先开发一个有限维马尔可夫化程序和算法,用指数核的混合来近似多元Hawkes过程。我们证明Hawkes过程的马尔可夫化近似、其强度和问题价值收敛到原始非马尔可夫过程和价值。然后我们在问题的马尔可夫化近似上构建连续时间确定性策略梯度学习,称为Hawkes-CT DDPG。我们提出一个无模型算法,通过仅观察过程的事件时间、SDE解的实现和一组选定的衰减滤波器来解决非马尔可夫Hawkes驱动的优化,而Hawkes核系数保持未知。我们将我们的连续时间强化学习Hawkes-CT DDPG方法与离散时间强化学习技术在三种不同类型的核下进行比较:简单指数、Erlang和幂律核。

原文摘要

We study stochastic control of multivariate Hawkes-driven stochastic differential equations with machine learning algorithms in a non-Markovian setting. Due to the path dependence of the memory of the Hawkes intensity, this problem does not fall within classical stochastic control theory outside particular Markovian kernels. We first develop a finite-dimensional Markovianization procedure and algorithm to approximate multivariate Hawkes processes with mixtures of exponential kernels. We prove the convergence of the Markovianized approximation of the Hawkes process, its intensity, and the value of the problem to the original non-Markovian processes and the value of the primal problem. We then formulate continuous-time deterministic policy gradient learning on the Markovianized approximation...


自动采集于 2026-08-21

#论文 #arXiv #ML #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录