<?xml version="1.0"?>
<rss version="2.0">
   <channel>
      <title>Aprendizagem por Reforço by Thomas Ricardo Reinke</title>
      <link>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2</link>
      <description>Christyelen Kramel, Sezio Clener Nascimento e Thomas Ricardo Reinke
</description>
      <language>en-us</language>
      <pubDate>2022-03-22 22:50:15 UTC</pubDate>
      <lastBuildDate>2026-02-03 15:00:50 UTC</lastBuildDate>
      <webMaster>hello@padlet.com</webMaster>
      <image>
         <url>https://padlet.net/icons/png/1f916.png</url>
      </image>
      <item>
         <title>O que caracteriza a Aprendizagem por Reforço?</title>
         <author>thomasricardoreinke</author>
         <link>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2108491035</link>
         <description><![CDATA[<div>O aprendizado por reforço, emprega um sistema de recompensas e penalidades para obrigar o computador a resolver um problema sozinho.<br><br>Os resultados de cada tentativa do aprendizado por reforço, independente de seu sucesso, são utilizados para treinar o agente por meio de um sistema de recompensa/punição e determinar se as ações tomadas são válidas ou não. Daí a ideia de aprendizado por reforço. O agente aprende tanto com os erros quanto com os acertos, e no final é esperado que ele execute a tarefa com maestria.<br><br></div>]]></description>
         <enclosure url="https://padlet-uploads.storage.googleapis.com/1638897682/743d0706ae270720106125f58ae27f77/reinforcement_learning_696x568_1.png" />
         <pubDate>2022-03-22 22:50:15 UTC</pubDate>
         <guid>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2108491035</guid>
      </item>
      <item>
         <title>Corrida de Taxi</title>
         <author>thomasricardoreinke</author>
         <link>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2108491041</link>
         <description><![CDATA[<div>No vídeo apresentado pela professora, o taxi tem a missão de buscar um passageiro , e ele recebe certas "Punições" ou "Recompensas" dependendo da atitude tomada por ele.<br>Cada movimentação dele ele recebe uma &nbsp;avaliação pontuada,  os caminhos corretos recebem positivos até a busca do passageiro e se ele for para caminhos errados ele recebe negativos.</div>]]></description>
         <enclosure url="https://padlet-uploads.storage.googleapis.com/1638897682/916e54703e8a2377d36a969e20cc8a18/taxi_rodando_em_frente_times_square_em_nova_iorque_5c5348687e93c.webp" />
         <pubDate>2022-03-22 22:50:15 UTC</pubDate>
         <guid>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2108491041</guid>
      </item>
      <item>
         <title></title>
         <author>thomasricardoreinke</author>
         <link>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2108491044</link>
         <description><![CDATA[<div>No aprendizado não supervisionado, é quando eu não tenho uma resposta especifica, e eu quero que o algoritmo descubra sozinho as relações dos dados.<br><br></div><div>No aprendizado não supervisionado, o agente não sabe se errou ou não, já o aprendizado por reforço tem recompensas por suas ações corretas para alcançar o melhor resultado, com um ambiente e um agente, e dependendo a ação do agente no ambiente ele é recompensado positivamente ou negativamente.</div>]]></description>
         <enclosure url="https://padlet-uploads.storage.googleapis.com/1423114344/a2759636d6c60fc0dc60ddbb11ec946d/WhatsApp_Image_2022_03_22_at_22_37_38.jpeg" />
         <pubDate>2022-03-22 22:50:15 UTC</pubDate>
         <guid>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2108491044</guid>
      </item>
      <item>
         <title></title>
         <author>thomasricardoreinke</author>
         <link>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2108491052</link>
         <description><![CDATA[<div>Os elementos geralmente envolvidos no aprendizado por reforço, são: O ambiente, o agente, a ação, a recompensa e o estado.<br><br>No aprendizado por reforço, o sistema de inteligência artificial enfrenta uma situação.&nbsp;<br><br>O computador utiliza tentativa e erro para encontrar uma solução para o problema.&nbsp;<br><br><br></div>]]></description>
         <enclosure url="https://padlet-uploads.storage.googleapis.com/1638897682/f1f1f245c1deb26ab2b41fbeba06f209/Sem_t_tulo.png" />
         <pubDate>2022-03-22 22:50:15 UTC</pubDate>
         <guid>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2108491052</guid>
      </item>
      <item>
         <title></title>
         <author>thomasricardoreinke</author>
         <link>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2108491055</link>
         <description><![CDATA[<div>O aprendizado supervisionado ocorre quando<strong> </strong>o modelo aprende a partir de resultados pré-definidos<br>Estes mesmos valores servem como “supervisão” destas previsões, permitindo o ajuste nas previsões com base nos erros.<br><br>Já no aprendizado por reforço, diferente do supervisionado, não possui um modelo, a inteligência artificial recebe recompensas ou penalidades pelas ações que executa. Seu objetivo é maximizar a recompensa total.</div>]]></description>
         <enclosure url="https://padlet-uploads.storage.googleapis.com/1423114344/0d30c1ba19be3754ddd78f9f2f36ea3f/WhatsApp_Image_2022_03_22_at_22_37_26.jpeg" />
         <pubDate>2022-03-22 22:50:15 UTC</pubDate>
         <guid>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2108491055</guid>
      </item>
      <item>
         <title>Jogos</title>
         <author>thomasricardoreinke</author>
         <link>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2108584405</link>
         <description><![CDATA[<div>O AlphaGo, IA responsável por jogar um jogo chamado Go, foi treinado com inúmeros jogos humanos, já alcançou um desempenho super-humano usando a rede de valor e a pesquisa de árvores Monte Carlo (MCTS) em sua rede de políticas.&nbsp;</div>]]></description>
         <enclosure url="https://padlet-uploads.storage.googleapis.com/1638897682/787af0e4aa736abd50328f9e5dc6bd6e/34518d61d28210be1ac6f6116368c4a3.png" />
         <pubDate>2022-03-23 00:23:27 UTC</pubDate>
         <guid>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2108584405</guid>
      </item>
      <item>
         <title></title>
         <author>thomasricardoreinke</author>
         <link>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2110610004</link>
         <description><![CDATA[<div>https://www.deeplearningbook.com.br/aplicacoes-da-aprendizagem-por-reforco-no-mundo-real/</div>]]></description>
         <enclosure url="https://www.deeplearningbook.com.br/aplicacoes-da-aprendizagem-por-reforco-no-mundo-real/" />
         <pubDate>2022-03-23 21:57:42 UTC</pubDate>
         <guid>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2110610004</guid>
      </item>
      <item>
         <title></title>
         <author>thomasricardoreinke</author>
         <link>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2110633170</link>
         <description><![CDATA[<div>https://www.deeplearningbook.com.br/o-que-e-aprendizagem-por-reforco/</div>]]></description>
         <enclosure url="https://www.deeplearningbook.com.br/o-que-e-aprendizagem-por-reforco/" />
         <pubDate>2022-03-23 22:24:09 UTC</pubDate>
         <guid>https://padlet.com/thomasricardoreinke/nbtjx3jnp1h3jhh2/wish/2110633170</guid>
      </item>
   </channel>
</rss>
