Resumo do Cap.2 do Livro: Reinforcement Learning: An Introduction de Richard S. Sutton e Andrew G. Barto - Evaluative Feedback
1. Métodos de valor pra ação (action-value)
Assume-se que existe uma função Q(a) de valor para cada ação, e o objetivo do agente é fazer uma esstimativa dessa função. A função pode ser por exemplo a média de todos os reforços recebidos por cada ação, de modo que a ação ótima seria a que possui maior estimativa de valor.
2. Aproveitar x Experimentar (Exploit x Explore)
Um dos desafios do aprendizado por reforço é equilibrar o compromisso entre aproveitar a ação ótima do momento ou experimentar novas ações que podem ter reforço ainda maior. Uma das técnicas é o método ε-greedy: o agente escolhe a ação ótima com probabilidade 1-ε ou uma ação aleatória com probabilidade ε. No entanto, se ε for constante, o agente nunca terá performance 100% ótima.
3. Softmax
Softmax é outro método para guiar a escolha das ações. Ao contrário do ε-greedy que escolhe totalmente aleatoriamente uma ação, o Softmax atribui probabilidades a todas as ações, sendo que as melhores são mais prováveis (baseado nas estimativas de valor pra ação). Assim, todas as ações podem ser escolhidas e quanto maior diferença houver nas estimativas, mais provável será a esoclha da melhor. As distribuições mais comumente usadas são a de Gibbs ou Boltzmann.
4. Atualização incremental
A fórmula geral para se atualizar um valor incrementalmente é:
NovaEstimativa = ValorVelho + Passo[ValorNovo - ValorVelho]
Se o passo for 1/num. passos, o valor será sempre a média.
5. Problemas dinâmicos
O problema pode não ser estacionário e com o passar do tempo os reforços podem mudar pra cada ação. Nessa caso, fazer a média de todos os reforços pode ser ruim, sendo melhor dar maior importância aos reforços mais recentes. Para isso pode-se usar a atualização incremental da estimativa de Q(a) com um passo constante 0 < alfa < 1. Q' = Q + alfa(reforço - Q)
6. Inicialização otimista
Experimentar todas as ações no início é importante, para se conhecer logo melhor as opções disponíveis. Para incentivar essa exploração, podemos inicializar as estimativas de valor de maneira otimista. Por exemplo, se sabemos que os reforços raramente passam de 10, podemos inicializar as estimativas de todas ações com o valor de 50 de modo que sempre que for experimentada, esse valor vai baixar. Aí todas as que não foram experimentadas ainda terão estimativa maior e portanto serão as melhores do momento, e ai serão experimentadas também.
7. Comparação de reforços
8. Perseguição

