设为首页加入收藏
  • 首页
  • 热点
  • 知识
  • 时尚
  • 探索
  • 综合
  • 娱乐
  • 当前位置:首页 >独速 >推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺

    发布时间:2025-07-13 02:13:43 来源:视角吃瓜网- 每天追踪文化视角,乐享丰富时光 作者:风谈专

    2025 年 1 月 20 日 Kimi k1.5 正式发布,推特伴随着工艺报告的热帖公布,有网友表示:“这应该是因为艺全球范围内,除 OpenAI 之外的作团公司首次实现 o1 正式版的多模态推理性能了吧!”

    一时间,项工Kimi k1.5 成了话题王者。推特医生工作中走光全集

    但在一个月后的热帖 2 月 24 日,X 上出现了一篇关于 Kimi k1.5 的因为艺工艺爆料帖,博主直言 k1.5 所用到的作团强化学习运算规则,其实是项工借鉴了自己在 24 年 5 月提出的一种名为 SPPO 的工艺。

    消息一出,推特瞬间吸引了数万人关注。热帖

    推特热帖:k1.5 很牛,因为艺因为借鉴了 UCLA 与 CMU 合作团队的作团这项工艺

    Kimi k1.5 背后的 SPPO 工艺

    在这则爆料中,博主 Yue Wu 先是项工对 SPPO 进行了简单解释,并且附上了相关论文(https://arxiv.org/abs/2405.00675),简单来说,SPPO是一种自博弈运算规则,最初的动机来源于刻画广泛意义上的人类偏好,并且使用了如下图所示的平方损失函数:

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的<strong>菲律宾外籍技师视频</strong>这项工艺

    值得一提的是,点开论文链接,你会发现原来 Yue Wu  和 Zhiqing Sun 同为这篇文章的第一作者。

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺

    紧接着,他开始对 SPPO 工艺进行解析:

    通过迭代求解上式中的 theta_t,我们可以得到一个与人类偏好对齐良好的语言模型。SPPO 使用胜率(红色部分)作为奖励,并用常数近似基线(蓝色部分)。

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺

    让我们感兴趣的是,我们发现它与 RLHF 目标的策略梯度有着深层的联系:如果我们直接用普通的策略梯度优化 RLHF (人类反馈强化学习)目标会怎样?根据策略梯度定理,策略梯度实际上也具有平方损失形式(蓝色项是策略梯度中的基线):

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺

    从数学上,我们证明了 SPPO 的平方损失等价于普通策略梯度的一种半在线变体:

    SPPO 中的胜率充当奖励函数(红色部分)。

    分区函数项自然地成为(软)值函数(蓝色部分)。

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺

    那么这到底意味着什么呢?

    标准策略梯度(PPO、GRPO、REINFORCE)在每一步都收集遵循当前策略的样本。

    SPPO 在每次迭代开始时只采样一次,然后通过平方损失进行优化。

    这使得 SPPO 成为一种轻量级的 RLHF 方法——无需即时生成!

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺

    上述分析揭示了大型语言模型(LLM)后训练阶段一个有趣的增长趋势:

    离线 DPO(IPO、KTO 等)取代 RLHF(奖励模型 + 强化学习)

    迭代 DPO、SPPO 等方法将离线方法转化为在线对齐方法

    更加精细的迭代 → 回归到在线强化学习

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺

    鉴于 GRPO(Deepseek-R1)和平方损失(Kimi k1.5)的成功,端到端强化学习的强大作用愈发凸显,或许在大型语言模型(LLM)后训练阶段无需额外技巧——价值函数、广义优势估计(GAE),甚至梯度裁剪都无需使用。

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺

    另一个简单但有趣的发现是,他们发现 SPPO 暗中在词汇级别优化最优最大熵策略。其平方损失隐含地最小化了学习到的策略与最优词汇级别策略之间的 KL 散度。

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺

    在我们后续的研究 GPO 中,我们直接最小化相对奖励与对数比率之间的平方损失。这两项工作中的平方损失等价于策略梯度,但它是以迭代的方式进行的。

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺

    SPPO 工艺背后的科研大牛

    除了提出助力 Kimi k1.5 大获成功的 SPPO 工艺外,Wu Yue 也是一个学术背景很强的科研大牛。他本科期间师从北京大学的王立威教授,博士期间师从加利福尼亚大学洛杉矶分校的顾全全教授,目前以博士后研究员的身份在普林斯顿大学机器智能实验室继续着自己的科研之路。推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺

    除此之外,2023 年至今他一共参与发布了 9 篇 Paper,其中 3 篇均为第一作者。

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺

    强大的学术背景之外,Wu Yue 的实习经历也非常加分。2022 年至 2024 年,他分别在 NEC 美研院、字节美国 AI lab和 Meta 工作实习。在 NEC 美研院期间,Wu Yue 从事个性化联邦学习研究,并开发了一种基于混合模型的方法,该方法被 ICML 2023 接受发表;在字节美国 AI lab 时,他专注于药品发现领域的多构象生成,将分子动力学的物理先验纳入基于扩散的生成模型,相关成果被 ICML 2024 接受;来到 Meta 后,Wu Yue 又致力于词汇级别奖励建模和新架构设计,用于一般人类偏好和一般偏好优化,为生成式机器智能的增长做出了贡献。

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺雷峰网(公众号:雷峰网)还了解到,与他同为第一作者的 Zhiqing Sun ,目前已经从 CMU 毕业,并在今年 2 月加入 OpenAI。

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺


    雷峰网原创文章,未经授权禁止转载。详情见转载须知。

    推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺

    • 上一篇:女子孕前期长时间休假,“副处老公”扮演什么角色
    • 下一篇:李彦宏在百度世界2023:我们即将进入一个AI原生的时代

      相关文章

      • 2D变3D,电影之城邀你“入画”
      • 《紫川之光明王》今日收官 杨旭文刘宇宁张铭恩三兄弟重新收回远州失地
      • 管乐姐姐变身青牛精来萌探“乘风破浪”!《萌探奇遇记》第五期全程高能
      • 胡元军世界夫人大赛集团董事局主席出席第78届戛纳电影节
      • “丹娜丝”携强降雨继续作用南方 北方闷热“上线”
      • AIS 5G 携手泰旅局打造数字化出游新体验,助力泰国跃升全球热门目的地
      • 短剧非常关系四川拍摄再掀热潮
      • 阿里鱼与中央美术学院深度合作,助力中央美院毕业季IP开发创新
      • 在 AI 战场里拿掉英特尔,PC 能活吗?
      • 中新建交35周年 《我们来了》Let's Go China 侨约八桂节目在百色开机录制

        随便看看

      • 为每个用户提供专属定制服务,OPPO 安第斯大模型的新卷法
      • 北京人艺73周年院庆探讨“艺术+科技”
      • 掌阅科技出品短剧《遮天》定档6月20日!AI技术与实拍画面深度结合
      • 古北水镇官宣“童话古北 奇遇嘉年华”,邀您共赴夏日梦幻之约
      • 美图视觉大模型3.0:让设计师做甲方
      • 沪藏音乐家同奏《喜马拉雅》 “音乐使者”诉说高原故事
      • 《寻访大师》:以国际传播之视野,书写跨国度之文明互鉴
      • 第27届上海国际电影节今开幕,与你共享流动光影盛宴 世界电影开启“上海时间”
      • 美国洛杉矶一隧道坍塌 15人被困
      • 陈嘉琦《红白大战》表现惊艳 获赞迷你版陈慧琳
      • Copyright © 2025 Powered by 推特热帖:k1.5 很牛,因为借鉴了 UCLA 与 CMU 合作团队的这项工艺,视角吃瓜网- 每天追踪文化视角,乐享丰富时光  sitemap