首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏探物及理

    化学习笔记9:探索和利用 exploration and exploitation

    最佳的策略是用长期的眼光来看,放弃短期高回报 获取足够策略是让策略变成全局最优的必要条件

    2.6K30发布于 2020-08-31
  • 来自专栏杨熹的专栏

    化学9: 当 Action 的空间连续时

    之前骑自行车的例子中,action 可以是向左或者向右,现在的话可能是一个实数值的区间。

    1.3K20发布于 2018-12-17
  • 来自专栏用户6881919的专栏

    论文阅读9-----基于强化学习的推荐系统

    With the recent advances in Reinforcement Learning (RL),there have been tremendous interests in employing RL fo recommender systems. However, directly training and evaluating a new RL-based recommendation algorithm needs to

    81800发布于 2021-01-18
  • 来自专栏数据魔术师

    化学习读书笔记(9)| On-policy Prediction with Approximation(上)

    在我们想要应用强化学习的许多任务中,状态空间是组合的和巨大的。 要在AI或大部分工程问题中使用强化学习,就必须考虑泛化的问题。为了解决该问题,所有监督学习的函数逼近方法均可以用于强化学习的value估计。最适合的监督学习方法可能是使用参数的函数逼近。

    1.1K21发布于 2019-10-09
  • 来自专栏新智元

    只要9美元!LoRA+强化学习,DeepSeek 1.5B推理性能暴涨20%

    新智元报道 编辑:KingHZ 【新智元导读】南加州大学团队只用9美元,就能在数学基准测试AIME 24上实现超过20%的推理性能提升,效果好得离谱! 而其核心技术只需LoRA+强化学习,用极简路径实现超高性价比后训练。 只用9美元,在数学基准测试AIME 24上,实现了超过20%的推理性能提升! 论文链接:https://arxiv.org/abs/2504.15777 在AIME 24推理任务中,最好的新模型实现了超过20%的性能提升,达到了43%的Pass@1准确率,而训练和评估的总成本仅为9美元 在六个推理任务上,Tina模型与相应的全参数训练的最先进(SOTA)模型之间的性能比较 而且,复现表现最佳Tina检查点只需花费9美元,若从头开始复现实验的全部过程,成本也仅为526美元! 基于LoRA的强化学习中的阶段转 根据这些观察,研究者提出了关于基于LoRA的强化学习后训练方法有效性的假设: Tina训练方法之所以有效且高效,是因为LoRA能够迅速调整模型,让模型适应强化学习所奖励的推理结构

    29610编辑于 2025-05-04
  • 来自专栏云计算行业

    化学

    阅读本文大约需要5分钟 一、强化学习的模型 强化学习能够实现很多的任务,这些任务目标往往可以归纳化为最大化长期奖励、最小化长期惩罚。 三、深度学习给强化学习带来的新机会 最近几年的强化学习非常的热门,出现了一些脍炙人口的应用,他们都是深度学习和强化学习强强联合的产物,无论是基于价值的强化数据算法,还是基于策略梯度的强化学习算法,都可以脱离于深度学习存在 2013年,深度学习和强化学习结合起来,结合成了的深度强化学习算法。那么深度强化学习算法诞生以后,在强化训练领域马上就有突飞猛进的发展,解决问题的困难程度大大超过之前的非深度强化算法。 深度强化学习算法为什么常常能够比非深度强化学习算法更厉害呢,这是因为用了深度学习的强化学习方法可以求得更加复杂的解,能在更加困难的问题上得到更好的性能。 接下来推荐下我的新书《强化学习原理与Python实现》,这里面的既包括了经典的非深度强化学习算法,也包括深度强化学习算法。

    61320编辑于 2023-05-29
  • 来自专栏有三AI

    【强化学习】从强化学习基础概念开始

    在开始探索强化学习的诸多算法之前,我们先来了解一下它所涉及到的具体概念。这些概念将作为基石,一直陪伴着我们的学习之旅。 为了能够将这些概念熟记在心,我们这一期做成强化学习概念小卡片,一张一张给大家展示和帮助大家理解。 在强化学习中,环境指排除智能体之外的所有组成。 (3) 智能体 智能体是强化学习中的主要研究对象,我们希望智能体能够通过环境的检验来实现系统的目标。 (4) 交互 交互专指智能体与环境的交互。 (8) 试错 试错是早期强化学习的主要方向。通过试错来探索最优策略。目前强化学习研究的方向转为奖励函数的优化。 (9) 记忆 智能体对过往经验的总结归纳和采用的方式。 3 强化学习中的六类问题 虽然强化学习给出了一个非常通用的解决问题的思路,但是面对具体问题,在不同场景下,强化学习又会有不同的侧重。

    80020发布于 2019-07-27
  • 来自专栏NowlNowl_AI

    化学习第1天:强化学习概述

    介绍 强化学习是机器学习中一种独特的存在,以其独特的思想逐渐发展为一门独立的学科,强化学习适用的场景是:一个学习主体根据环境做出不同的决策,得到相应的奖励与惩罚来改进决策 它既不是监督学习也不是无监督学习 ,从这段描述中也可以看出,它不适合用来进行回归或者聚类等任务 强化学习要素 强化学习中有一些重要的概念,我们接下来一一介绍他们,如果有些不理解不要着急,我们会举一个具体例子来解释 智能体:智能体是强化学习中的主体 环境搭建:gym gym是一个集成了一些常用环境的库,我们可以通过调用这个环境库来快速入门强化学习,在python命令行中执行命令安装 ! plt.imshow(image) plt.show() 这段代码完成了一些初始设置,具体作用见代码注释,运行结果如下图 ​ 环境信息查看 我们导入环境后要查看一些环境的信息,还记得我们最开始说的强化学习要素吗 学习了强化学习的基本概念 通过一个简单示例直观感受了强化学习的基本流程 学习了将图片动画化的技术

    65320编辑于 2024-01-18
  • 来自专栏智药邦

    JCIM|利用化学语言模型导航超大虚拟化学空间

    化学语言模型为探索这些广阔的化学空间提供了一种新方法。然而,现有的模型在生成的化合物的合成可行性和目标特性优化方面仍存在不足。 图1: PoE化学语言模型示意图 随着计算化学的飞速发展,虚拟化学空间的规模呈现指数增长。超大规模的化学空间为药物研发提供了无数的化合物候选,但完全筛选这些空间几乎是不可能的。 计算复杂度高:随着虚拟化学库规模的增加,筛选计算资源消耗也随之线性增长,难以快速评估化合物的药效和物理化学特性。 2. 在PoE化学语言模型中,研究者结合了以下三种模型: 1. 预训练模型:该模型在超大化学空间上进行训练,提供对整个空间的全面理解。它可以为生成化合物提供基本的化学结构。 2. 本文提出的PoE化学语言模型,通过结合预训练模型、专家模型和反专家模型,实现了对超大虚拟化学空间的高效导航和探索。

    26610编辑于 2024-11-01
  • 来自专栏机器学习算法原理与实践

    化学习(十九) AlphaGo Zero强化学习原理

        在强化学习(十八) 基于模拟的搜索与蒙特卡罗树搜索(MCTS)中,我们讨论了MCTS的原理和在棋类中的基本应用。 这里我们在前一节MCTS的基础上,讨论下DeepMind的AlphaGo Zero强化学习原理。      当然这类强化学习算法只对特定的这类完全状态可见,信息充分的问题有效,遇到信息不对称的强化学习问题,比如星际,魔兽之类的对战游戏问题,这个算法就不那么有效了。 要推广AlphaGo Zero的算法到大多数普通强化学习问题还是很难的。因此后续强化学习算法应该还有很多发展的空间。      至此强化学习系列就写完了,之前预计的是写三个月,结果由于事情太多,居然花了大半年。但是总算还是完成了,没有烂尾。生活不易,继续努力! (欢迎转载,转载请注明出处。

    2.1K50发布于 2019-04-01
  • 来自专栏WOLFRAM

    Wolfram|Alpha 化学分步解答方案:化学反应

    如果您正在学习化学,或者正在学习要求化学先修课程的学科,那么您就会知道所需教科书的价格是多少。为了解决这个问题,化学教育界已经开发了开放的教育资源,以提供免费的化学教科书。 在接下来的几周中,我们将探索中学生、高中生和大学生在化学课程和期末考试中遇到的一些热门主题:化学反应、结构和键合、化学溶液,最后是量子化学。阅读例如化学反应中的问题及其分步解决方案! 平衡化学方程式 化学的基本方面是平衡化学方程式。如果化学方程式是表达化学过程的语言,那么平衡化学方程式就是相应的语法。分步解决方案将带您逐步了解强大的代数方法,以识别化学计量系数。 化学转化 在几乎所有的化学作业或研究问题中,都会出现化学转化。这样,逐步解决方案可用于在摩尔、质量、体积、分子和原子之间转换。提供了单位转换和尺寸分析的详细信息。 还有更多化学反应 无论您是为即将来临的期末考试而学习,为家庭作业困惑还是只是想复习一下,化学反应都是Wolfram | Alpha知识库涵盖的许多化学主题之一。

    74120发布于 2020-05-21
  • 来自专栏深度学习

    【深度学习】强化学习(五)深度强化学

    一、强化学习问题   强化学习的基本任务是通过智能体与环境的交互学习一个策略,使得智能体能够在不同的状态下做出最优的动作,以最大化累积奖励。 上述概念可详细参照:【深度学习】强化学习(一)强化学习定义 4、马尔可夫决策过程   为了简化描述,将智能体与环境的交互看作离散的时间序列。 关于马尔可夫决策过程可详细参照:【深度学习】强化学习(二)马尔可夫决策过程 5、强化学习的目标函数   强化学习的目标是通过学习一个良好的策略来使智能体在与环境的交互中获得尽可能多的平均回报。 关于目标函数可详细参照:【深度学习】强化学习(三)强化学习的目标函数 6、值函数   在强化学习中,为了评估策略 \pi 的期望回报,引入了值函数的概念,包括状态值函数和状态-动作值函数。    关于值函数可详细参照:【深度学习】强化学习(四)强化学习的值函数 7、深度强化学习   深度强化学习是将强化学习和深度学习结合在一起,用强化学习来定义问题和优化目标,用深度学习来解决状态表示、策略表示和值函数建模等问题

    1.4K10编辑于 2024-07-30
  • 来自专栏小明的博客

    化学

    化学习(reinforcement learning.)是指智能系统在与环境的连续互动中学习最优行为策略的机器学习问题。 强化学习的本质是学习最优的序贯决策。

    49330编辑于 2022-09-05
  • 来自专栏li_wait

    打印9*9乘法口诀

    j = 1; j <=i; j++) { printf("%d*%d=%d ", j, i, i * j); } printf("\n"); } return 0; } 打印9* 9乘法口诀表: 从图中看出第四排和第五排没有对齐,要想对齐,可以考虑 printf限定占位符的最小宽度(https://blog.csdn.net/wait___wait/article /details/135287228) 9*9乘法口诀表中最大位数是2,因此设最小宽度为2。

    44810编辑于 2024-10-23
  • 来自专栏LhWorld哥陪你聊算法

    【强化学习篇】--强化学习案例详解一

    转变为如下图:先构造奖励,达到5,即能够走得5的action则说明奖励比较高设置成100,没有达到5说明奖励比较低,设置成0。

    1.4K10发布于 2018-09-13
  • 来自专栏技术杂记

    9

    服务端 /var/log/messages 中会出现类似的日志Aug 25 00:26:02 pptp-server pptpd[10177]: CTRL: Client 103.240.124.15 control connection startedAug 25 00:26:02 pptp-server pptpd[10177]: CTRL: Starting call (launching pppd, opening GRE)Aug 25 00:26:02 pptp-server pppd[10178

    97820编辑于 2022-06-30
  • 来自专栏学习

    机器学习——强化学习与深度强化学

    化学习与深度强化学习:从基础到深入 引言 近年来,强化学习(Reinforcement Learning, RL)在多个领域取得了巨大的进展。 本篇文章将深入探讨强化学习与深度强化学习的基本原理、常见算法以及应用场景,旨在为读者提供一个详尽的学习路线图。 1. 强化学习基础 1.1 什么是强化学习 强化学习是一种让智能体(Agent)通过与环境(Environment)交互,获得奖励(Reward)来学习如何采取行动的学习方法。 深度强化学习的应用 3.1 游戏 AI 深度强化学习被广泛应用于游戏 AI 中,最著名的例子莫过于 DeepMind 开发的 AlphaGo,它通过深度强化学习击败了人类围棋冠军。 未来,随着算法的改进和计算能力的提升,深度强化学习将在更多领域取得突破。 本篇文章介绍了强化学习和深度强化学习的基础理论、常见算法及其应用,希望能够帮助读者更好地理解这一领域。

    3.4K10编辑于 2024-10-09
  • 来自专栏云+直播

    化学

    点击观看大咖分享 强化学习的模型 强化学习能够实现很多的任务,这些任务目标往往可以归纳化为最大化长期奖励、最小化长期惩罚。 ---- 深度学习给强化学习带来的新机会 最近几年的强化学习非常的热门,出现了一些脍炙人口的应用,他们都是深度学习和强化学习强强联合的产物,无论是基于价值的强化数据算法,还是基于策略梯度的强化学习算法, 2013年,深度学习和强化学习结合起来,结合成了的深度强化学习算法。那么深度强化学习算法诞生以后,在强化训练领域马上就有突飞猛进的发展,解决问题的困难程度大大超过之前的非深度强化算法。 深度强化学习算法为什么常常能够比非深度强化学习算法更厉害呢,这是因为用了深度学习的强化学习方法可以求得更加复杂的解,能在更加困难的问题上得到更好的性能。 接下来推荐下我的新书《强化学习原理与Python实现》,这里面的既包括了经典的非深度强化学习算法,也包括深度强化学习算法。

    68600发布于 2020-06-06
  • 来自专栏机器之心

    9年实现爱因斯坦级AGI?OpenAI科学家Dan Roberts谈强化学习扩展的未来

    的版本更是采用了一个更吸引人的标题:「9 年实现 AGI? 在这场演讲中,Dan Roberts 介绍了预训练和强化学习的 Scaling Law,并预测强化学习将在未来的 AI 模型构建中发挥越来越大的作用,而随着强化学习继续扩展,我们最终将造出有能力发现新科学的模型 正如你们许多人知道的,去年 9 月,OpenAI 发布了一个名为 o1 的模型。 我这里展示的是一张图表,y 轴代表模型在某种数学推理基准测试上的表现,但真正有趣的是 x 轴。 o3 用到了一些强化学习,但未来强化学习计算的比重会更大。到某个时候,强化学习计算可能会成为主导。 这是我从 Yann LeCun 的幻灯片借的一张图,大概是他 2019 年的一场演讲。 我想,或许 9 年后,我们就将有能发现广义相对论的模型。 © THE END 转载请联系本公众号获得授权

    18100编辑于 2025-05-12
  • 来自专栏LhWorld哥陪你聊算法

    【强化学习篇】--强化学习从初识到应用

    一、前述 强化学习是学习一个最优策略(policy),可以让本体(agent)在特定环境(environment)中,根据当前的状态(state),做出行动(action),从而获得最大回报(G or 强化学习的过程:先行动,再观察 再行动 再观测…  每一个动作(action)都能影响代理将来的状态(state),通过一个标量的奖励(reward)信号来衡量成功,目标:选择一系列行动来最大化未来的奖励

    63720发布于 2018-09-13
领券