| 查看: 698 | 回复: 4 | |||
[求助]
关于reinforcement learning: an introduction中通过policy产生episode的问题已有1人参与
|
| 在读reinforcement learning: an introduction这本书的时候,伪代码里面经常出现generate an episode using \pi, 但是也没有说具体怎么产生。看到有一个例子里面,说产生的是s0, a0, r0, s1, a1, r1, ....也就是说会产生state, action 和reward,那么请问 这里的s0, s1是随机的吗?有没有人有关于通过policy产生episode的具体例子或者材料?谢谢 |
» 猜你喜欢
三无产品还有机会吗
已经有3人回复
投稿返修后收到这样的回复,还有希望吗
已经有7人回复
压汞仪和BET测气凝胶孔隙率
已经有4人回复
博士申请都是内定的吗?
已经有14人回复
谈谈两天一夜的“延安行”
已经有13人回复
氨基封端PDMS和HDI反应快速固化
已经有11人回复
之前让一硕士生水了7个发明专利,现在这7个获批发明专利的维护费可从哪儿支出哈?
已经有11人回复
论文投稿求助
已经有4人回复
Applied Surface Science 这个期刊。有哪位虫友投过的能把word模板发给我参考一下嘛
已经有3人回复
投稿精细化工
已经有6人回复
» 本主题相关商家推荐: (我也要在这里推广)
dreamrequiem
木虫 (小有名气)
- 应助: 17 (小学生)
- 金币: 3948.3
- 红花: 3
- 帖子: 186
- 在线: 1215.4小时
- 虫号: 1302136
- 注册: 2011-05-21
- 专业: 人工智能与知识工程
2楼2014-02-28 11:45:07
3楼2014-02-28 12:06:47
dreamrequiem
木虫 (小有名气)
- 应助: 17 (小学生)
- 金币: 3948.3
- 红花: 3
- 帖子: 186
- 在线: 1215.4小时
- 虫号: 1302136
- 注册: 2011-05-21
- 专业: 人工智能与知识工程
4楼2014-02-28 12:41:08
5楼2014-02-28 12:52:26













回复此楼