Tag

大模型

共 110 篇文章 · 第 1 / 2 页

从 Next-Token 到 Next-Concept:语言模型的预训练任务,还有得改进吗?

从 Next-Token 到 Next-Concept:语言模型的预训练任务,还有得改进吗?

当全世界都在疯狂给大语言模型堆算力、卷数据、扩上下文时,我们是否曾停下来质疑过那个统治了整个生成式AI时代的底层铁律——Next Token Prediction(下一个词预测)? 人类说话写文章,从不是大脑里机械地蹦出一个字才去想下一个字;我们永远是 “先有概念与意图,后有遣词与造句”。 近日,来
wangguo
0
0
65
Harness基模JIT-27B,为每个任务写一套“Claude Code”

Harness基模JIT-27B,为每个任务写一套“Claude Code”

Harness基模JIT-27B,为每个任务写一套“Claude Code” Agent benchmark 通常把模型视为能力的主要来源,但同一模型只要更换记忆组织、规划协议、工具暴露方式或错误恢复流程,最终表现就可能跨越一个明显的档位。 这样的差异来自 Agent Harness:它定义模型在什
wangguo
0
0
164
直播预告!聊聊大语言模型在 latent space(隐空间)里的优化和推理

直播预告!聊聊大语言模型在 latent space(隐空间)里的优化和推理

语言模型的推理能力已成为当前研究的焦点,但传统思维链(CoT)受限于自然语言这一"思维介质",人类许多认知过程从未被显式书写,因而无法被模型从数据中习得。 在最新的研究中提出了一种新视角:将推理重新表述为"价值引导的隐空间优化",即不依赖外部信息,直接在模型内部隐空间中沿价值梯度搜索更优解。 8月2
wangguo
0
0
130
大模型 MoE 负载均衡的 N 种方法

大模型 MoE 负载均衡的 N 种方法

作者:觉醒也醉了 https://zhuanlan.zhihu.com/p/2066914125012283729 MoE 中的负载 假设一个 batch(或一个路由 group)中有 T 个 token、N 个 routed experts,每个 token 选择 k 个 Expert。 Rout
wangguo
0
0
245
苏剑林|解构 Scaling Law:优化、架构、数据的三重奏

苏剑林|解构 Scaling Law:优化、架构、数据的三重奏

作者:苏剑林 原文:https://kexue.fm/archives/11833 训练一个大型的神经网络,最终效果会受到非常多因素的影响,换个优化器,换个模型架构,或者换一个训练集,结果都可能截然不同。 在工程实践中,我们将调试这些因素的经验结果,戏称为“炼丹”。 但如何从经验上升到规律,更准确、
wangguo
0
0
156
从推理角度看 kimi k3

从推理角度看 kimi k3

作者:SuSun https://zhuanlan.zhihu.com/p/2061411883958137356 从推理角度看一下 Kimi K3,2.8 T, fp4 的话, 1.4 TB,hopper 其实也还行。但肯定这个架构说白了给 B 卡定制的,就是不知道国产卡是否受益了(投机一下,其实
wangguo
0
0
159
直播预告!周六上午10点,聊聊 PithTrain:Agent 时代的 MoE 训练框架设计

直播预告!周六上午10点,聊聊 PithTrain:Agent 时代的 MoE 训练框架设计

陈天奇团队最新开源 PithTrain:Agent 时代的 MoE 训练框架设计 专家混合模型(MoE)已经成为当前大语言模型的主流架构,相应的生产级训练框架也经过多年工程积累,具备了优异的训练性能。 然而,随着新的模型架构和系统优化不断涌现,在这些大型框架上进行开发和演进仍然成本高昂。 随着 AI
wangguo
0
0
123
深入理解 Agentic RL 中的行为崩塌现象

深入理解 Agentic RL 中的行为崩塌现象

作者:Jason 原文:https://zhuanlan.zhihu.com/p/2050794185909876253 过去一段时间里,我一直在思考一个问题:Agentic RL 到底和传统 RLVR 有什么本质区别? 最容易想到的答案当然是工具调用。传统 RLVR 往往围绕单轮回答展开,模型生成
青稞
0
0
252
把投机采样讲透:以 SGLang 中的 EAGLE-2 为例

把投机采样讲透:以 SGLang 中的 EAGLE-2 为例

投机采样(Speculative Decoding)这两年几乎成了 LLM 推理加速的标配,但真正理解它的人不多。很多人停留在”小模型猜、大模型验”这一句话上,一到细节就懵:主模型 verify 的时候到底在算什么?为什么一次前向能验好几个 token?长上下文到底是帮忙还是帮倒忙? 这篇文章以 S
青稞
0
0
228
ZEDA:将 Post-Trained MoE 迁移为高效动态 MoE

ZEDA:将 Post-Trained MoE 迁移为高效动态 MoE

MoE 通过稀疏激活在扩大参数容量的同时控制计算量;Dynamic MoE 可以动态调整专家激活数量,让简单 token 使用更少计算,从而进一步提升推理效率。 6 月 9 日(周二)晚 8 点,青稞 Talk 第 130 期,清华大学博士生吕兴泰,将直播分享《ZEDA:将 Post-Trained
wangguo
0
0
108
自动化所最新推出 π-Play: 基于自博弈生成特权信息的自蒸馏大模型自进化框架

自动化所最新推出 π-Play: 基于自博弈生成特权信息的自蒸馏大模型自进化框架

作者:张曜程,朱圆恒,赵冬斌@中科院自动化所 研究背景 智能体在训练过程中往往面临几个核心瓶颈,标注数据昂贵、奖励信号稀疏,以及长程任务中的信用分配困难。自博弈(Self-Play)提供了一条很有吸引力的路径:模型可以自己生成问题、自己学习解决问题,从而减少对外部训练数据的依赖。然而,现有自博弈方法
青稞
0
0
217
长文本推理一定要改架构?阿里最新提出 RTPurbo:仅需百步训练,无损达到 97%+ 稀疏度与 9 倍加速

长文本推理一定要改架构?阿里最新提出 RTPurbo:仅需百步训练,无损达到 97%+ 稀疏度与 9 倍加速

作者:周琰轲,南京大学二年级硕士研究生,阿里巴巴实习生,RTP-LLM项目核心贡献者 长上下文能力已成为现代大语言模型的基础要求,但全注意力机制(Full Attention)随序列长度呈平方级增长的计算复杂度,构成了推理阶段的核心瓶颈。为了缓解这一问题,目前业界主要探索了两条技术路线: 1.Tra
青稞
0
0
141
 如何合成 Agentic 事实性 SFT / Mid-train 数据?

如何合成 Agentic 事实性 SFT / Mid-train 数据?

作者:好奇的小逸 原文:https://zhuanlan.zhihu.com/p/2036619681105228260 最近正好在搞 agentic factual ability的问题,就想着先总结一下目前的内容,这里首先想一下我们的目标是什么?直接给出结果的普通事实类问答吗?显然不是。我们这里
青稞
0
0
231
经验分享!如何进行 Mid-train 以及 SFT 的 Query 筛选

经验分享!如何进行 Mid-train 以及 SFT 的 Query 筛选

作者:好奇的小逸 https://zhuanlan.zhihu.com/p/2035128896316756341 之前再做Mid-train和SFT时,积攒了一些经验,一直没有去写这方面的内容,这次就好好的总结一下相关的内容, 首先我们先有个认知就是:真正影响训练效果的,往往不是总量,而是样本的信
青稞
0
0
351
 工业级 LLM 预训练数据工程的关键实践!

工业级 LLM 预训练数据工程的关键实践!

作者:李煜东 Yudong https://zhuanlan.zhihu.com/p/2032080549381190858 写在前面: LLM 研究的关注重心正在这几年内不断转移,从post train到强化学习再到agentic/harness工作流。这些都体现了技术前沿和社区焦点的演进。对于用
青稞
0
0
797
MOE 架构如何做 SFT 和 RL?聊聊 post-training 难点与经验

MOE 架构如何做 SFT 和 RL?聊聊 post-training 难点与经验

作者:燕雄飞的一天 https://zhuanlan.zhihu.com/p/2018018879109091590 无论是开源还是顶尖商业模型,moe架构已经成为绝对主流,区别于dense模型,在sft和rl阶段有什么独特的训练难点或者挑战,对于这些挑战如何缓解。期望从基础原理入手,看如何训练mo
青稞
0
0
641
从 Depth Scaling 到 Width Scaling!WideSeek-R1:通过多智能体 RL 探索大模型的广度扩展(Width Scaling)

从 Depth Scaling 到 Width Scaling!WideSeek-R1:通过多智能体 RL 探索大模型的广度扩展(Width Scaling)

DeepSeek-R1 的成功证明,深度扩展(Depth Scaling)在复杂逻辑推理中具有巨大潜力。但当任务从“深推理”转向“广信息”——如汇总全球头部科技公司多维财务数据——单一大模型往往受限于多轮检索带来的上下文干扰与串行效率瓶颈。 为此,我们提出“广度扩展”(Width Scaling)这
wangguo
0
0
195
线性轨迹:揭示 LLM 强化学习中的高效捷径

线性轨迹:揭示 LLM 强化学习中的高效捷径

LLM RL 训练轨迹竟然是线性的?Miaow Lab 最新工作:无需继续训练,直接“预测”未来模型! 研究发现,在RLVR训练过程中,LLM的权重和输出概率演化呈现出显著的线性特征,理论分析发现,这源于低学习率、大Batch Size及Adam优化器的特性。说明昂贵的RLVR存在大量冗余计算。 基
wangguo
0
0
203
一张表串讲LLM-RL中KL散度正则的正确与错误用法

一张表串讲LLM-RL中KL散度正则的正确与错误用法

作者:龙心尘 https://zhuanlan.zhihu.com/p/2005366418179385192 声明:为突出重点,部分背景知识已略去,同时涵盖的内容也难免有疏漏之处,还望读者理解。 背景说明 1.KL散度正则化涉及多种决策项,包括:使用正向KL散度还是逆向KL散度(2种)、将其置于损
青稞
0
0
317
只改几个 Token,就能教会大模型新知识,还不忘旧知识?

只改几个 Token,就能教会大模型新知识,还不忘旧知识?

想微调一小部分,为什么模型会“连带变笨”? 很多人第一次微调大模型都会被一个现象吓到:你只是想教它一件很小的事——比如“某个术语必须按公司口径解释”,结果训练完它在别的题型上反而变差了,甚至一些原本答得挺稳的常识也开始飘。 这就是大家熟悉的灾难性遗忘(catastrophic forgetting)
青稞
0
0
250
标准LLMs的替代方案:线性注意力混合模型|文本扩散|代码世界模型|小型递归Transformer

标准LLMs的替代方案:线性注意力混合模型|文本扩散|代码世界模型|小型递归Transformer

从DeepSeek R1到MiniMax-M2,当今最大且功能最强的开源权重大型语言模型(LLMs)仍然是基于原始多头注意力机制变体的自回归解码器式Transformer。 然而,近年来我们也看到了标准LLMs的替代方案不断涌现,从文本扩散模型到最新的线性注意力混合架构。其中一些旨在提高效率,而另一
青稞
0
0
595
从 BF16 到 FP16:如何解决RL训练-推理不匹配问题

从 BF16 到 FP16:如何解决RL训练-推理不匹配问题

大语言模型(LLM)的强化学习(RL)微调常因训练与推理策略间的数值不匹配而面临训练不稳定的问题。相比在算法上引入重要性采样来打补丁,我们发现直接从根源上提高浮点数的精度更加有效。 论文:Defeating the Training-Inference Mismatch via FP16 链接:ht
wangguo
0
0
417
Fast-dLLM v2:高效训练推理的块扩散大语言模型框架

Fast-dLLM v2:高效训练推理的块扩散大语言模型框架

在往期的 #青稞Talk 中,香港大学MMLab博士生吴成岳,曾直播分享过Fast-dLLM!Fast-dLLM 是 NVIDIA 联合香港大学、MIT等机构推出的扩散大语言模型推理加速方案。 关于 Fast-dLLM 的介绍可以参考: 港大&NV&MIT开源Fast-dLLM:无需重新训练模型,直
wangguo
0
0
383
Generative RLHF-V: 面向多模态 RLHF 的人类意图对齐框架

Generative RLHF-V: 面向多模态 RLHF 的人类意图对齐框架

训练与人类意图对齐的多模态大模型是一个长期挑战。传统的基于分数的奖励模型在强化学习(RLHF)中存在准确性低、泛化性弱和可解释性差等问题。 11月15日(周六)上午10点,青稞社区和减论平台将联合组织青稞Talk 第89期,并邀请到北京大学博士生周嘉懿,直播分享《Generative RLHF-V:
青稞
0
0
355
RL 训练框架:QeRL 量化技术增强强化学习 Reasoning 探索

RL 训练框架:QeRL 量化技术增强强化学习 Reasoning 探索

11月8日(周六)上午10点,青稞Talk 第87期,香港大学直博生黄炜,将直播分享《RL 训练框架:QeRL,量化技术增强强化学习 Reasoning 探索》。 分享嘉宾 黄炜,香港大学三年级直博生,师从齐晓娟教授。英伟达研究院Efficient AI & Learning and Percept
青稞
0
0
279
OpenMoE 2: Sparse Diffusion Language Models

OpenMoE 2: Sparse Diffusion Language Models

11月4日(周二)晚8点,青稞Talk 第85期,NUS AI Researcher倪瑾杰,将直播分享《OpenMoE 2: Sparse Diffusion Language Models》,聊一聊为什么 Diffusion MoE 可能是下一代大模型架构方向。 分享嘉宾 倪瑾杰,NUS AI R
青稞
0
0
224
统一 SFT & RL:迈向大型语言模型后训练的统一视角

统一 SFT & RL:迈向大型语言模型后训练的统一视角

10月28日(周二)晚8点,青稞Talk 第83期,清华大学博士生吕兴泰,将直播分享《统一 SFT & RL:迈向大型语言模型后训练的统一视角》。 分享嘉宾 吕兴泰,清华大学二年级博士生,导师为周伯文教授。研究方向为大语言模型架构优化、强化学习和高效训练技术。在ACL,EMNLP,NeurIPS,I
青稞
0
0
304
RL for LRMs:探讨面向推理模型的 RL 最新研究

RL for LRMs:探讨面向推理模型的 RL 最新研究

10月21日(周二)晚8点,青稞Talk 第80期,清华大学博士生张开颜,将直播分享《RL for LRMs:探讨面向推理模型的 RL 最新研究》。 分享嘉宾 张开颜,清华大学三年级博士生,导师为周伯文教授。研究方向为大语言模型测试时扩展(Test-time Scaling)、强化学习和多智能体协同
青稞
0
0
377
从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体

从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体

9月18日(周四)晚8点,青稞Talk 第78期,新加坡国立大学博士生张桂彬,将直播分享《从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体》。 分享嘉宾 张桂彬是新加坡国立大学计算学院博士研究生,导师为颜水成教授,研究方向为Multi-Agent System,Agent M
青稞
0
0
695
ROLL:面向 Agentic 场景的生产级大规模强化学习训练框架

ROLL:面向 Agentic 场景的生产级大规模强化学习训练框架

8月23日(周六)上午10点,青稞Talk 第74期,淘天集团未来生活实验室算法专家王维埙博士,爱橙科技智能引擎算法平台大模型强化学习框架工程师熊绍潘,将直播分享《ROLL:面向 Agentic 场景的生产级大规模强化学习训练框架》。 代码:https://github.com/alibaba/RO
青稞
0
0
717
大模型训练流水线并行四部曲:吞吐、内存、负载均衡与线性扩展

大模型训练流水线并行四部曲:吞吐、内存、负载均衡与线性扩展

8月5日晚8点,青稞Talk 第67期,Sea AI Lab(新加坡)算法工程师,新加坡国立大学博士生万信逸,将直播分享《大模型训练流水线并行四部曲:吞吐、内存、负载均衡与线性扩展》。 分享嘉宾 万信逸,Sea AI Lab(新加坡)算法工程师,新加坡国立大学博士生,专注机器学习系统领域的创新与突破
青稞
0
0
422
ProRL: 延长强化学习训练框架,拓展大语言模型的推理边界

ProRL: 延长强化学习训练框架,拓展大语言模型的推理边界

7月12日上午10点,青稞Talk 第62期,英伟达公司研究员刁诗哲,将直播分享《ProRL: 延长强化学习训练框架,拓展大语言模型的推理边界》。 分享嘉宾 刁诗哲,英伟达公司研究员,曾以访问学者身份在伊利诺伊大学厄巴纳-香槟分校从事研究,并在字节跳动人工智能实验室与创新工场人工智能研究院实习。研究
青稞
0
0
273
大模型推理强化学习中的熵机制

大模型推理强化学习中的熵机制

往期解读:聊聊在大模型推理强化学习中熵机制上的探索 强化学习已经成为大模型智能跃升的下一个增长点,在这个背景下,本文旨在解决将强化学习用于大语言模型推理时面临的一个主要障碍——策略熵塌缩问题。 这种现象在大量未引入熵干预的强化学习训练中普遍出现,表现为策略熵在训练初期急剧下降,探索能力随之减弱,并始
青稞
0
0
613
MoLE & SpeCache:大语言模型端侧部署的架构与算法

MoLE & SpeCache:大语言模型端侧部署的架构与算法

LM在多个领域表现出强大能力,尽管在线服务广泛应用,但出于隐私和离线需求,个人常需要端侧部署。然而,现有的基于MoE和Transformer架构的LLM在端侧部署时面临显存容量不足的挑战。 5月22日20:00,青稞Talk 第50期,北京大学智能学院博士生、华为诺亚方舟实验室实习生节世博,将直播分
青稞
0
0
287
verl 源码解读 与 HybridFlow 编程范式讲解

verl 源码解读 与 HybridFlow 编程范式讲解

5月19晚8点,verl core contributor 童雨轩,将直播分享《verl 源码解读 与 HybridFlow 编程范式讲解》。 本次 Talk 会从entrypoint(例如 main_ppo.py)入手,按程序执行顺序讲解 verl 的主要逻辑(类似 debugger 视角,但经过
青稞
0
0
973
从 TTS 到 TTRL:无标签数据强化学习探索与展望

从 TTS 到 TTRL:无标签数据强化学习探索与展望

在预训练 Scaling Law之后,测试时扩展(Test-time Scaling, TTS)已成为提升大模型推理能力的关键。OpenAI o1与DeepSeek R1等模型通过强化学习(RL)进行推理的范式,充分展现了TTS的潜力。然而,推理模型的性能上限仍深受基础模型(其架构与预训练数据)的制
青稞
0
0
349
B-STaR & SimpleRL-Zoo:通过强化学习自我提升推理性能和效率

B-STaR & SimpleRL-Zoo:通过强化学习自我提升推理性能和效率

基于强化学习框架的自我提升正日益成为增强模型推理能力的关键后训练方法,这一方法直接促成了DeepSeek-R1的成功。 青稞Talk 第45期,香港科技大学(HKUST)计算机系博士生曾伟豪,将直播分享《B-STaR & SimpleRL-Zoo:通过强化学习自我提升推理性能和效率》。 B-STaR
青稞
0
0
243
COAT:显存高效的 FP8 训练,实现高效深度学习

COAT:显存高效的 FP8 训练,实现高效深度学习

3月22日上午11点 ,青稞Talk 第42期,COAT 第一作者、加州大学伯克利分校计算机科学博士生席浩诚,将直播分享《COAT:显存高效的 FP8 训练,实现高效深度学习》。 分享嘉宾 席浩诚是加州大学伯克利分校计算机科学博士一年级学生,导师是Kurt Keutzer教授,研究方向为大型语言模型
青稞
0
0
184
基于 LightLLM 的 DeepSeek R1/V3 模型部署实战

基于 LightLLM 的 DeepSeek R1/V3 模型部署实战

3月8日上午11点,青稞Talk 第40期,商汤科技大模型工具体系团队研究员、LightLLM 核心开发人员白世豪,将直播分享《基于 LightLLM 的 DeepSeek R1/V3 模型部署实战》。 分享嘉宾 白世豪,商汤科技大模型工具体系团队研究员,LightLLM核心开发人员,主要负责大语言
青稞
0
0
252
PRIME: 结合隐式过程奖励的强化学习

PRIME: 结合隐式过程奖励的强化学习

2月22日上午11点,青稞Talk 第39期,上海人工智能实验室青年科学家崔淦渠,将直播分享《PRIME: 结合隐式过程奖励的强化学习》。 主讲嘉宾 崔淦渠,上海人工智能实验室青年科学家,博士毕业于清华大学计算机系,导师为刘知远副教授。研究方向为大语言模型的对齐与强化学习技术。在ICML, Neur
青稞
0
0
238
Satori:通过训练LLM做自回归搜索来增强推理能力

Satori:通过训练LLM做自回归搜索来增强推理能力

2月15日上午11点,青稞Talk 第38期,Satori第一作者、MIT博士生沈茂昊,将直播分享《Satori:通过训练LLM做自回归搜索来增强推理能力》。 主讲嘉宾 沈茂昊,MIT EECS系四年级博士生,长期和MIT-IBM Watson AI lab 合作,本科毕业于UIUC ECE系。研究
青稞
0
0
123
XGrammar:高效实现 LLM灵活且可移植的结构化生成

XGrammar:高效实现 LLM灵活且可移植的结构化生成

12月21日11点,青稞Talk 第33期,CMU 博士生董易昕,将直播分享《XGrammar:高效实现 LLM灵活且可移植的结构化生成》。 分享嘉宾 董易昕,卡内基梅隆大学计算机科学系的一年级博士生,导师为陈天奇教授;本科毕业于上海交通大学计算机科学专业(ACM班);研究聚焦于机器学习与系统的交叉
青稞
0
0
273
LLMC:大语言模型压缩工具的开发实践

LLMC:大语言模型压缩工具的开发实践

12月16日晚8点,青稞Talk第32期,商汤科技研究院谷石桥和雍洋两位模型压缩研究员,将对LLMC进行直播分享,主题为《LLMC:大语言模型压缩工具的开发实践》。 他们将从工具框架设计,常用算法解读和工具使用方式等角度,为大家详细讲解LLMC及实践,希望大家可以从中获益。 主讲嘉宾 谷石桥,商汤科
青稞
0
0
190
VILA^2 :视觉语言模型能力的自我提升

VILA^2 :视觉语言模型能力的自我提升

主讲嘉宾 方云浩,本科毕业于浙江大学,硕士毕业于UCSD(苏昊教授),自24年2月起在Nvidia VILA团队实习(陆垚博士、韩松教授)。主要科研方向是大模型相关的1. 推理能力(通过探索提升推理上限: Unleashing the Creative Mind;通过演绎验证获得可靠思维链: Ded
青稞
0
0
140
VITA:开源交互式多模态基础大模型

VITA:开源交互式多模态基础大模型

10月14日19点,青稞Talk 第26期,VITA 第一作者,南京大学智能科学与技术学院研究员、助理教授、博导傅朝友,将直播分享《VITA:开源交互式多模态基础大模型》。 主讲嘉宾 傅朝友,南京大学智能科学与技术学院研究员,助理教授,博导。2022年博士毕业于中国科学院自动化研究所,2022年-2
青稞
0
0
202
1 2
正在直播 B 站