Aprendizado por Reforço é aprender o que fazer em cada situação, de modo a maximizar sua recompensa. O agente deve descobrir o que fazer com tentativas e deve considerar não apenas as recompensas imediatas, mas as futuras também. É diferente do Aprendizado Supervisionado no qual o agente recebe exemplos do que fazer por um supervisor. Um agente de aprendizado por reforço possui um objetivo explícito, pode sentir alguns aspectos do ambiente e realizar ações que modificam-no e assim deve explorá-lo para encontrar a melhor política de ação.
Podemos identificar 4 elementos principais num sistema de aprendizado por reforço: a política, a função de recompensa, uma função de valor e um modelo do ambiente. A política representa qual a melhor ação a se fazer em cada estado. Ou seja, é o comportamento do agente, que deve ser otimizado com o aprendizado. A função recompensa atribui um número para cada estado. Quando o agente atinge determinado estado do ambiente, ele recebe essa recompensa. Isso define qual é o objetivo dele, que será o estado com a maior recompensa. A função valor representa a recompensa acumulada (e não imediata). Ela dá valor a todos os estados numa determinada seuência de ações que leva ao objetivo. O componente central dos algoritmos de aprendizado por reforço é como estimar e atualizar essa função. O modelo, opcional, pode ajudar a predizer o próximo estado e recompensa.
No Cap. 11 teremos o exemplo do sistema de Gerry Tesauro que possui a capacidade de generalizar a sua experiência
Nenhum comentário:
Postar um comentário