Tag

大模型推理

共 20 篇文章

直播预告!聊聊大语言模型在 latent space(隐空间)里的优化和推理

直播预告!聊聊大语言模型在 latent space(隐空间)里的优化和推理

语言模型的推理能力已成为当前研究的焦点,但传统思维链(CoT)受限于自然语言这一"思维介质",人类许多认知过程从未被显式书写,因而无法被模型从数据中习得。 在最新的研究中提出了一种新视角:将推理重新表述为"价值引导的隐空间优化",即不依赖外部信息,直接在模型内部隐空间中沿价值梯度搜索更优解。 8月2
wangguo
0
0
130
从推理角度看 kimi k3

从推理角度看 kimi k3

作者:SuSun https://zhuanlan.zhihu.com/p/2061411883958137356 从推理角度看一下 Kimi K3,2.8 T, fp4 的话, 1.4 TB,hopper 其实也还行。但肯定这个架构说白了给 B 卡定制的,就是不知道国产卡是否受益了(投机一下,其实
wangguo
0
0
159
直播预告!周六上午10点,聊聊 PithTrain:Agent 时代的 MoE 训练框架设计

直播预告!周六上午10点,聊聊 PithTrain:Agent 时代的 MoE 训练框架设计

陈天奇团队最新开源 PithTrain:Agent 时代的 MoE 训练框架设计 专家混合模型(MoE)已经成为当前大语言模型的主流架构,相应的生产级训练框架也经过多年工程积累,具备了优异的训练性能。 然而,随着新的模型架构和系统优化不断涌现,在这些大型框架上进行开发和演进仍然成本高昂。 随着 AI
wangguo
0
0
123
深入理解 Agentic RL 中的行为崩塌现象

深入理解 Agentic RL 中的行为崩塌现象

作者:Jason 原文:https://zhuanlan.zhihu.com/p/2050794185909876253 过去一段时间里,我一直在思考一个问题:Agentic RL 到底和传统 RLVR 有什么本质区别? 最容易想到的答案当然是工具调用。传统 RLVR 往往围绕单轮回答展开,模型生成
青稞
0
0
252
MinT: 面向百万级 LoRA 策略的训练与推理基础设施

MinT: 面向百万级 LoRA 策略的训练与推理基础设施

大模型后训练会带来一个很现实的系统问题:模型会不断产生新版本。一次强化学习实验、一个产品功能、一个客户、一组评测结果,都可能对应一种新的模型行为。基础模型本身又非常大,动辄万亿参数规模。系统如果把每种行为都保存成一份完整模型,再分别加载和部署,成本会很快失控。 MinT 是一套面向这个问题的大模型后
wangguo
0
0
223
长文本推理一定要改架构?阿里最新提出 RTPurbo:仅需百步训练,无损达到 97%+ 稀疏度与 9 倍加速

长文本推理一定要改架构?阿里最新提出 RTPurbo:仅需百步训练,无损达到 97%+ 稀疏度与 9 倍加速

作者:周琰轲,南京大学二年级硕士研究生,阿里巴巴实习生,RTP-LLM项目核心贡献者 长上下文能力已成为现代大语言模型的基础要求,但全注意力机制(Full Attention)随序列长度呈平方级增长的计算复杂度,构成了推理阶段的核心瓶颈。为了缓解这一问题,目前业界主要探索了两条技术路线: 1.Tra
青稞
0
0
139
DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配

DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配

4月25日,当 DeepSeek-V4 带着 1.6 万亿参数(Pro版)和百万级上下文窗口的震撼配置横空出世时,整个大模型圈的目光都聚焦在了它极具野心的架构革新上:混合稀疏注意力(CSA+HCA)、流形约束超连接(mHC)以及 FP4 专家权重。 然而,对于广大开发者和企业用户而言,面对如此庞大且
wangguo
0
0
660
MOE 架构如何做 SFT 和 RL?聊聊 post-training 难点与经验

MOE 架构如何做 SFT 和 RL?聊聊 post-training 难点与经验

作者:燕雄飞的一天 https://zhuanlan.zhihu.com/p/2018018879109091590 无论是开源还是顶尖商业模型,moe架构已经成为绝对主流,区别于dense模型,在sft和rl阶段有什么独特的训练难点或者挑战,对于这些挑战如何缓解。期望从基础原理入手,看如何训练mo
青稞
0
0
640
从 BF16 到 FP16:如何解决RL训练-推理不匹配问题

从 BF16 到 FP16:如何解决RL训练-推理不匹配问题

大语言模型(LLM)的强化学习(RL)微调常因训练与推理策略间的数值不匹配而面临训练不稳定的问题。相比在算法上引入重要性采样来打补丁,我们发现直接从根源上提高浮点数的精度更加有效。 论文:Defeating the Training-Inference Mismatch via FP16 链接:ht
wangguo
0
0
416
Fast-dLLM v2:高效训练推理的块扩散大语言模型框架

Fast-dLLM v2:高效训练推理的块扩散大语言模型框架

在往期的 #青稞Talk 中,香港大学MMLab博士生吴成岳,曾直播分享过Fast-dLLM!Fast-dLLM 是 NVIDIA 联合香港大学、MIT等机构推出的扩散大语言模型推理加速方案。 关于 Fast-dLLM 的介绍可以参考: 港大&NV&MIT开源Fast-dLLM:无需重新训练模型,直
wangguo
0
0
383
RL 训练框架:QeRL 量化技术增强强化学习 Reasoning 探索

RL 训练框架:QeRL 量化技术增强强化学习 Reasoning 探索

11月8日(周六)上午10点,青稞Talk 第87期,香港大学直博生黄炜,将直播分享《RL 训练框架:QeRL,量化技术增强强化学习 Reasoning 探索》。 分享嘉宾 黄炜,香港大学三年级直博生,师从齐晓娟教授。英伟达研究院Efficient AI & Learning and Percept
青稞
0
0
278
ProRL: 延长强化学习训练框架,拓展大语言模型的推理边界

ProRL: 延长强化学习训练框架,拓展大语言模型的推理边界

7月12日上午10点,青稞Talk 第62期,英伟达公司研究员刁诗哲,将直播分享《ProRL: 延长强化学习训练框架,拓展大语言模型的推理边界》。 分享嘉宾 刁诗哲,英伟达公司研究员,曾以访问学者身份在伊利诺伊大学厄巴纳-香槟分校从事研究,并在字节跳动人工智能实验室与创新工场人工智能研究院实习。研究
青稞
0
0
273
Fast-dLLM:无需重训的扩散大语言模型推理加速

Fast-dLLM:无需重训的扩散大语言模型推理加速

Fast-dLLM 是NVIDIA联合香港大学、MIT等机构推出的扩散大语言模型推理加速方案。 其通过分块KV缓存与置信度感知并行解码技术,在无需重新训练模型的前提下,实现了推理速度的突破性提升——在LLaDA模型1024 token长文本生成任务中,端到端推理速度狂飙27.6倍,整体耗时从266秒
青稞
0
0
456
MoLE & SpeCache:大语言模型端侧部署的架构与算法

MoLE & SpeCache:大语言模型端侧部署的架构与算法

LM在多个领域表现出强大能力,尽管在线服务广泛应用,但出于隐私和离线需求,个人常需要端侧部署。然而,现有的基于MoE和Transformer架构的LLM在端侧部署时面临显存容量不足的挑战。 5月22日20:00,青稞Talk 第50期,北京大学智能学院博士生、华为诺亚方舟实验室实习生节世博,将直播分
青稞
0
0
286
正在直播 B 站