<?xml version="1.0"?>
<oembed><version>1.0</version><provider_name>Instituto de Ingenier&#xED;a del Conocimiento</provider_name><provider_url>https://www.iic.uam.es/en</provider_url><author_name>Instituto de Ingenier&#xED;a del Conocimiento</author_name><author_url>https://www.iic.uam.es/en/author/andres/</author_url><title>Reinforcement Learning - IIC</title><type>rich</type><width>600</width><height>338</height><html>&lt;blockquote class="wp-embedded-content" data-secret="N5UNUOWZZE"&gt;&lt;a href="https://www.iic.uam.es/en/artificial-intelligence/reinforcement-learning/"&gt;Reinforcement Learning&lt;/a&gt;&lt;/blockquote&gt;&lt;iframe sandbox="allow-scripts" security="restricted" src="https://www.iic.uam.es/en/artificial-intelligence/reinforcement-learning/embed/#?secret=N5UNUOWZZE" width="600" height="338" title="&#x201C;Reinforcement Learning&#x201D; &#x2014; Instituto de Ingenier&#xED;a del Conocimiento" data-secret="N5UNUOWZZE" frameborder="0" marginwidth="0" marginheight="0" scrolling="no" class="wp-embedded-content"&gt;&lt;/iframe&gt;&lt;script type="text/javascript"&gt;
/* &lt;![CDATA[ */
/*! This file is auto-generated */
!function(d,l){"use strict";l.querySelector&amp;&amp;d.addEventListener&amp;&amp;"undefined"!=typeof URL&amp;&amp;(d.wp=d.wp||{},d.wp.receiveEmbedMessage||(d.wp.receiveEmbedMessage=function(e){var t=e.data;if((t||t.secret||t.message||t.value)&amp;&amp;!/[^a-zA-Z0-9]/.test(t.secret)){for(var s,r,n,a=l.querySelectorAll('iframe[data-secret="'+t.secret+'"]'),o=l.querySelectorAll('blockquote[data-secret="'+t.secret+'"]'),c=new RegExp("^https?:$","i"),i=0;i&lt;o.length;i++)o[i].style.display="none";for(i=0;i&lt;a.length;i++)s=a[i],e.source===s.contentWindow&amp;&amp;(s.removeAttribute("style"),"height"===t.message?(1e3&lt;(r=parseInt(t.value,10))?r=1e3:~~r&lt;200&amp;&amp;(r=200),s.height=r):"link"===t.message&amp;&amp;(r=new URL(s.getAttribute("src")),n=new URL(t.value),c.test(n.protocol))&amp;&amp;n.host===r.host&amp;&amp;l.activeElement===s&amp;&amp;(d.top.location.href=t.value))}},d.addEventListener("message",d.wp.receiveEmbedMessage,!1),l.addEventListener("DOMContentLoaded",function(){for(var e,t,s=l.querySelectorAll("iframe.wp-embedded-content"),r=0;r&lt;s.length;r++)(t=(e=s[r]).getAttribute("data-secret"))||(t=Math.random().toString(36).substring(2,12),e.src+="#?secret="+t,e.setAttribute("data-secret",t)),e.contentWindow.postMessage({message:"ready",secret:t},"*")},!1)))}(window,document);
/* ]]&gt; */
&lt;/script&gt;
</html><description>[vc_row bg_image=&#x201D;14731&#x2033; text_color=&#x201D;light&#x201D; text_align=&#x201D;center&#x201D; top_padding=&#x201D;60&#x2033; bottom_padding=&#x201D;60&#x2033;][vc_column column_padding=&#x201D;padding-4&#x2033; width=&#x201D;1/1&#x2033;][vc_column_text] Reinforcement Learning and Optimization [/vc_column_text][vc_column_text] Las mejores estrategias a partir de los datos [/vc_column_text][/vc_column][/vc_row][vc_row top_padding=&#x201D;30&#x2033;][vc_column column_padding=&#x201D;padding-1&#x2033; width=&#x201D;1/1&#x2033;][vc_column_text] El Big Data, la Inteligencia Artificial o el Machine Learning se orientan hacia la automatizaci&#xF3;n y el apoyo en la toma de decisiones, pero se puede ir m&#xE1;s all&#xE1;. Con el conocimiento que proporcionan los datos, se pueden planear estrategias y optimizar tareas, procesos y servicios. [/vc_column_text][/vc_column][/vc_row][vc_row equal_height=&#x201D;yes&#x201D; content_placement=&#x201D;top&#x201D; type=&#x201D;full_width_section&#x201D; top_padding=&#x201D;0&#x2033; bottom_padding=&#x201D;0&#x2033;][vc_column bg_color=&#x201D;#3591c4&#x2033; column_padding=&#x201D;padding-3&#x2033; column_center=&#x201D;true&#x201D; text_color=&#x201D;light&#x201D; width=&#x201D;1/2&#x2033; delay=&#x201D;0&#x2033;][vc_column_text] &#xBF;Qu&#xE9; es el aprendizaje por refuerzo? [/vc_column_text][vc_column_text] El aprendizaje por refuerzo (o Reinforcement Learning) es una variedad del Machine Learning que permite a una Inteligencia Artificial planear estrategias efectivas en base a la experimentaci&#xF3;n con los datos. [/vc_column_text][vc_column_text] Se trata de una forma de optimizaci&#xF3;n basada en datos. La m&#xE1;quina aprende a partir de su propia experiencia, interaccionando con el entorno hasta dar con el comportamiento ideal. A partir de la informaci&#xF3;n disponible, emprender&#xE1; acciones que repetir&#xE1; y &#x201C;reforzar&#xE1;&#x201D; seg&#xFA;n las recompensas que obtenga, que pueden ser positivas o negativas. [/vc_column_text][/vc_column][vc_column bg_color=&#x201D;#f3f3f3&#x2033; column_padding=&#x201D;padding-3&#x2033; column_center=&#x201D;true&#x201D; width=&#x201D;1/2&#x2033;][vc_column_text] &#xBF;C&#xF3;mo funciona el aprendizaje por refuerzo? [/vc_column_text][vc_column_text] M&#xE1;s que tomar decisiones o hacer predicciones, el aprendizaje por refuerzo genera estrategias autom&#xE1;ticamente. Esto [&hellip;]</description></oembed>
