| 查看: 885 | 回复: 4 | ||
| 当前只显示满足指定条件的回帖,点击这里查看本话题的所有回帖 | ||
[求助]
关于reinforcement learning: an introduction中通过policy产生episode的问题 已有1人参与
|
||
| 在读reinforcement learning: an introduction这本书的时候,伪代码里面经常出现generate an episode using \pi, 但是也没有说具体怎么产生。看到有一个例子里面,说产生的是s0, a0, r0, s1, a1, r1, ....也就是说会产生state, action 和reward,那么请问 这里的s0, s1是随机的吗?有没有人有关于通过policy产生episode的具体例子或者材料?谢谢 |
» 猜你喜欢
今天系统多次维护,明天很可能放榜!
已经有5人回复
欢迎发来filecode的Mz6后的代码验证其规律
已经有74人回复
岩土工程学报什么时候才能终审完呐
已经有4人回复
时间戳又变了8-15
已经有25人回复
2027广东省杰青
已经有6人回复
快农历七夕节了,轻松一下,男人悄悄话,女施主请不要进来。
已经有3人回复
哪位老哥知道今年的国自然具体哪一天放榜?
已经有9人回复
咱们一起用铁证分析2026国家社科基金中标与否
已经有26人回复
我的国基提前知道中了,可是同事的操作让我实在接受不了,怎么会有这样的人
已经有16人回复
有时候,自然基金真的不能太认真 (我的申报经验)
已经有12人回复
» 本主题相关商家推荐: (我也要在这里推广)
3楼2014-02-28 12:06:47
dreamrequiem
木虫 (小有名气)
- 应助: 17 (小学生)
- 金币: 3948.3
- 红花: 3
- 帖子: 186
- 在线: 1215.4小时
- 虫号: 1302136
- 注册: 2011-05-21
- 专业: 人工智能与知识工程
2楼2014-02-28 11:45:07
dreamrequiem
木虫 (小有名气)
- 应助: 17 (小学生)
- 金币: 3948.3
- 红花: 3
- 帖子: 186
- 在线: 1215.4小时
- 虫号: 1302136
- 注册: 2011-05-21
- 专业: 人工智能与知识工程
4楼2014-02-28 12:41:08
5楼2014-02-28 12:52:26










回复此楼