|
|
[求助]
关于强化学习的一个问题
Q学习中的Q值更新公式为:Q t+1(st, at) = (1 - a) Qt(st, at) + [ Rt(st, at) + maxQ(st+1, ai)]
如果所有Q值初始化都为1的话,那么对于所有的Q t+1(st, at)在第二步的时候,这个公式的第一项(1 - a) Qt(st, at)是相同的,回报值Rt(st, at)是做出行为后的回报,也是相同的,而第三项也是相同的,这就导致所有的 Q t+1(st, at)都是相同的,就不能做出下一步的行为选择了.
一直被这个问题困扰,希望有懂的人给我解答一下,谢谢了
|
» 猜你喜欢
售SCI一区文章,我:8O5.5.1.O5.4,科目全,可伽急
已经有6人回复
售SCI一区T0P文章,我:8.O55.1.O.54,科目全,可十急
已经有8人回复
售SCI一区T0P文章,我:8.O.55.1.O.5.4,科目全,可+急
已经有8人回复
售SCI一区T0P文章,我:8O.55.1.O.54,科目全,可伽急
已经有10人回复
2026国自然函评费到账
已经有11人回复
售SCI一区T0P文章,我:8.O.55.1.O54,科目全,可伽急
已经有3人回复
售SCI一区文章,我:8O5.5.1.O5.4,科目全,可伽急
已经有3人回复
93BebMhtakh前后11位开头都是大写
已经有8人回复
售SCI一区T0P文章,我:8.O.55.1.O.5.4,科目全,可+急
已经有5人回复
范进中举一文的中心思想
已经有4人回复
» 本主题相关价值贴推荐,对您同样有帮助:
|