Tag

Infra

共 27 篇文章

MiniMax-H3 音视频生成 RL 后训练:基于 VeRL-Omni 的开源实践

MiniMax-H3 音视频生成 RL 后训练:基于 VeRL-Omni 的开源实践

引言 MiniMax-H3 是当前开源社区中最受关注的音视频生成模型之一。它是一个通用的多模态生成模型,接收文本、图像、视频、音频等多种输入,直接输出带原生立体声音轨的视频,支持最长 15 秒、最高 2K 分辨率、24 FPS、32 kHz 立体声。 在 Artificial Analysis 的
wangguo
0
1
393
Infra 也能自进化?Φ-Bench 深度评测:大模型距离“AI 工程师”还有多远?

Infra 也能自进化?Φ-Bench 深度评测:大模型距离“AI 工程师”还有多远?

过去几年,大语言模型(LLM)的能力快速提升。从写代码、完成复杂推理,到辅助科研和软件开发,模型正在逐渐成为越来越强大的工程助手。 但一个更深层的问题正在出现:如果模型能够帮助人类构建软件,大模型是否也能够反过来优化支撑自身运行的基础设施? 换句话说:Can Large Language Model
wangguo
0
0
102
直播预告!聊聊大语言模型在 latent space(隐空间)里的优化和推理

直播预告!聊聊大语言模型在 latent space(隐空间)里的优化和推理

语言模型的推理能力已成为当前研究的焦点,但传统思维链(CoT)受限于自然语言这一"思维介质",人类许多认知过程从未被显式书写,因而无法被模型从数据中习得。 在最新的研究中提出了一种新视角:将推理重新表述为"价值引导的隐空间优化",即不依赖外部信息,直接在模型内部隐空间中沿价值梯度搜索更优解。 8月2
wangguo
0
0
130
大模型 MoE 负载均衡的 N 种方法

大模型 MoE 负载均衡的 N 种方法

作者:觉醒也醉了 https://zhuanlan.zhihu.com/p/2066914125012283729 MoE 中的负载 假设一个 batch(或一个路由 group)中有 T 个 token、N 个 routed experts,每个 token 选择 k 个 Expert。 Rout
wangguo
0
0
245
从推理角度看 kimi k3

从推理角度看 kimi k3

作者:SuSun https://zhuanlan.zhihu.com/p/2061411883958137356 从推理角度看一下 Kimi K3,2.8 T, fp4 的话, 1.4 TB,hopper 其实也还行。但肯定这个架构说白了给 B 卡定制的,就是不知道国产卡是否受益了(投机一下,其实
wangguo
0
0
159
直播预告!周六上午10点,聊聊 PithTrain:Agent 时代的 MoE 训练框架设计

直播预告!周六上午10点,聊聊 PithTrain:Agent 时代的 MoE 训练框架设计

陈天奇团队最新开源 PithTrain:Agent 时代的 MoE 训练框架设计 专家混合模型(MoE)已经成为当前大语言模型的主流架构,相应的生产级训练框架也经过多年工程积累,具备了优异的训练性能。 然而,随着新的模型架构和系统优化不断涌现,在这些大型框架上进行开发和演进仍然成本高昂。 随着 AI
wangguo
0
0
123
DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配

DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配

4月25日,当 DeepSeek-V4 带着 1.6 万亿参数(Pro版)和百万级上下文窗口的震撼配置横空出世时,整个大模型圈的目光都聚焦在了它极具野心的架构革新上:混合稀疏注意力(CSA+HCA)、流形约束超连接(mHC)以及 FP4 专家权重。 然而,对于广大开发者和企业用户而言,面对如此庞大且
wangguo
0
0
660
从 Depth Scaling 到 Width Scaling!WideSeek-R1:通过多智能体 RL 探索大模型的广度扩展(Width Scaling)

从 Depth Scaling 到 Width Scaling!WideSeek-R1:通过多智能体 RL 探索大模型的广度扩展(Width Scaling)

DeepSeek-R1 的成功证明,深度扩展(Depth Scaling)在复杂逻辑推理中具有巨大潜力。但当任务从“深推理”转向“广信息”——如汇总全球头部科技公司多维财务数据——单一大模型往往受限于多轮检索带来的上下文干扰与串行效率瓶颈。 为此,我们提出“广度扩展”(Width Scaling)这
wangguo
0
0
195
超越精度:为什么训练-推理不一致是一个优化问题,以及简单的学习率调度(LR Scheduling)如何修复它

超越精度:为什么训练-推理不一致是一个优化问题,以及简单的学习率调度(LR Scheduling)如何修复它

在 LLM 强化学习(RL)的训练中,有一个长期困扰算法工程师的“幽灵”:训练-推理不一致(Training-Inference Mismatch) 。很多时候,你会发现训练开始阶段一切正常,但是一段时间后训练引擎和推理引擎生成token的概率分布就有可能越来越远,accuracy断崖式下跌。 主流
青稞
0
0
421
正在直播 B 站