1. 首页
  2. 青稞Talk
  3. 直播预告!聊聊大语言模型在 latent space(隐空间)里的优化和推理

直播预告!聊聊大语言模型在 latent space(隐空间)里的优化和推理

  • 发布于 2026-08-17
  • ·
  • 5 次阅读
  • ·
  • ·

语言模型的推理能力已成为当前研究的焦点,但传统思维链(CoT)受限于自然语言这一"思维介质",人类许多认知过程从未被显式书写,因而无法被模型从数据中习得。

在最新的研究中提出了一种新视角:将推理重新表述为"价值引导的隐空间优化",即不依赖外部信息,直接在模型内部隐空间中沿价值梯度搜索更优解。

26f5a295211cabf15006f7965672d209.png

8月22日(周六)10:00点​,青稞Talk 第147期,北京大学博士生李珩立,将直播介绍两项工作:LatentSeek & GradCuit。

LatentSeek 通过自奖励与策略梯度在测试时优化隐表示,在 GSM8K、MATH、AIME 等基准上显著超越 CoT。

Paper:Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space
arXiv:https://arxiv.org/abs/2505.13308v1
Code:https://github.com/bigai-nlco/LatentSeek

GradCuit 进一步解决信用分配问题,让梯度穿透模型内部回路,带来更强的鲁棒性。核心洞见是:好的隐空间,足以让"跟随价值梯度"成为解决复杂问题的通用路径。

Paper:Circuit-like Gradient Flow for Test-Time Instance-Level Latent Reasoning
arXiv:https://arxiv.org/abs/2608.02585
Code:https://github.com/Yuzhaoxin946/GradCuit

青稞介绍

李珩立,北京大学人工智能研究院自然语言处理方向的博士生,师从北京大学朱松纯教授、北京通用人工智能研究院(BIGAI)郑子隆研究员和北京大学张驰教授。他主要研究语言模型的隐空间推理与价值引导生成。他的工作探索如何通过隐变量方法改进语言建模,包括在推理阶段利用价值引导优化隐表示以提升推理能力,以及在训练阶段学习隐变量。他曾在 NeurIPS、ICLR、ICML 等顶级会议发表论文,代表性工作包括 LatentSeek、GradCuit等。

主题提纲

LatentSeek & GradCuit:从价值引导的隐空间优化看大语言模型推理

1、LLM 推理的瓶颈与 CoT 的局限
2、隐空间推理:从似然驱动到价值驱动
3、LatentSeek:自奖励与策略梯度驱动的测试时优化
4、GradCuit:梯度穿透回路,解决信用分配
5、实验验证:性能、鲁棒性与可解释性
6、核心洞见与未来方向 & AMA (Ask Me Anything)环节

直播时间

8月22日(周六)10:00 - 11:00

目录