博客
欢迎来到 HappyRock 博客!
在这里我们分享技术见解、项目更新和行业动态。
最新文章
想要投稿?请联系我们:info@happyrock.cloud
MMProLong长文档LMM训练新范式深度解析:问答对数据为何比OCR转录高效百倍——字节Seed团队与港科大联合研究
Friday, July 31, 2026 在 博客
一、引言:长文档多模态训练的"隐形成本" 2026年7月底,字节跳动Seed团队与香港科技大学联合发布了MMProLong——一个突破长文档多模态大语言模型(LMM)训练效率的新框架。这项研究揭示了一个被行业长期忽视的根本性问题:长文档LMM训练的瓶颈不在模型架构,而在训练数据的组织方式。 当前主流的长文档LMM训练思路是"OCR转录":将长文档扫描为图像,用OCR提取文本,然后喂给模型。但MMProLong的研究团队发现,这种方法不仅效率低下,在特定场景 …
LongStraw超长上下文训练突破深度解析:8卡H20跑通210万token强化学习——复旦MindLab显存墙攻破术
Friday, July 31, 2026 在 博客
LongStraw超长上下文训练突破深度解析:8卡H20跑通210万token强化学习——复旦MindLab显存墙攻破术 一、引言:AI训练中最荒诞的鸿沟 2026年7月,arXiv上悄然出现一篇编号为arXiv:2607.14952的论文——复旦大学与MindLab联合研发的LongStraw框架,首次在仅8块H20 GPU上,稳定跑通2,097,152个token(约210万字)的强化学习训练全流程。 这不是推理,不是"能看多长"的炫技——这是训练。是让AI真正学会 …
EvoLib测试时学习框架深度解析:微软无梯度知识演化库、IG与Future IG信用分配算法全解
Friday, July 31, 2026 在 博客
EvoLib测试时学习框架深度解析:微软无梯度知识演化库、IG与Future IG信用分配算法全解 一、引言:部署后的学习困境 2026年7月30日,Microsoft Research正式开源了EvoLib——一个测试时学习(Test-Time Learning, TTL)框架,它解决了大语言模型部署后的一个根本性矛盾:模型参数量动辄数千亿,但一旦部署上线,就变成了一个静态制品,无法从真实交互中积累经验。 当前主流的大模型应用范式本质上是"闭卷考试":所有知识都来自训练阶段 …
月之暗面Transformer三大基石重建深度解析:MoonShadow优化器、KDA线性注意力与Attention Residuals如何重塑LLM训练
Thursday, July 30, 2026 在 博客
引言 2026年7月底,月之暗面(Moonshot AI)创始人杨植麟在GTC2026上做了一场引起AI工程界震动的演讲。核心信息只有一个:要让开源模型追上闭源,仅靠堆参数和算力远远不够,必须重建Transformer的三大基础组件——优化器、注意力机制、残差连接。 这不是渐进式改进。月之暗面对Kimi K3的生产架构进行了彻底的手术:用自研的MoonShadow优化器替换Adam,用Kimi Delta Attention(KDA)线性注意力替换标准全注意力,用Attention …
Spotter AI遗忘的盲区深度解析:过遗忘问题与原型重学习攻击——ICML 2026机器遗忘技术全解
Thursday, July 30, 2026 在 博客
引言 机器遗忘(Machine Unlearning, MU)的目标是让AI模型"忘记"特定的训练数据,同时避免昂贵的重训练。听起来简单,但2026年7月被ICML 2026接收的这项研究揭示了两个被长期忽视的盲区: 过遗忘(Over-unlearning):删除目标类别时,会连带损害相似的保留类别。例如让模型"忘记猫",可能会削弱它识别老虎或豹子的能力。 重学习攻击(Relearning Attack):即使信息被删除,模型仅用少量样本就能恢复被遗忘的知 …
SenseNova-Vision统一视觉模型深度解析:一个模型通吃检测分割深度估计3D重建,架构零改动超越所有专用模型
Thursday, July 30, 2026 在 博客
引言 计算机视觉领域长期处于"一任务一模型"的碎片化局面——DETR做检测,SAM做分割,MoGe做深度估计,VGGT做3D重建……每个模型架构不同、数据格式不同、互不兼容。自动驾驶需要同时跑检测、深度估计和场景理解三四个模型,机器人抓取需要检测+分割+深度联合推理。 2026年7月,商汤科技联合南洋理工大学、香港中文大学、北京大学、上海交通大学、浙江大学,发布了SenseNova-Vision——一个统一多模态生成模型,同时覆盖检测、OCR、分割、深度估计、法线预测、多视图 …
Reinforced Dreamer非对称世界模型深度解析:特权信息表征缺陷修复与隐式引导的强化学习新范式
Thursday, July 30, 2026 在 博客
引言 世界模型(World Model)是强化学习中让智能体"在脑中预演未来"的核心技术。Dreamer系列算法通过学习环境的隐式模型,让智能体在想象中规划行动,已成为基于模型的强化学习(MBRL)的标杆方法。 但2026年7月28日发表在arXiv上的一项新研究揭示了Dreamer家族的一个根本性缺陷:当使用特权信息(Privileged Information)进行训练时,模型学会了依赖一个在测试时就会消失的"拐杖"。研究者提出的Reinforced …
英伟达实测AdamW优化器规模天花板深度解析:Muon/SOAP高阶优化器如何成为万亿参数训练新底座
Wednesday, July 29, 2026 在 博客
一、引言:AI训练优化器的"规模天花板"被发现 2026年7月28日,英伟达披露了一项可能改变大模型训练格局的研究成果:当batch size扩展至1亿token时,当前最主流的AdamW优化器训练稳定性急剧下降,而Muon、SOAP等新型高阶优化器仍保持一致收敛。 这一发现的工程意义极为重大。在过去五年中,AdamW几乎是所有大模型训练的事实标准——从GPT-3到LLaMA,从DeepSeek到Gemini,几乎无一例外。如果AdamW在更大的规模上存在根本性的稳定性问题, …
英伟达50亿美元投资SSI深度解析:Vera Rubin平台、AI融资循环化与Safe Superintelligence技术架构
Wednesday, July 29, 2026 在 博客
一、引言:史上最大AI融资操作背后的技术逻辑 2026年7月28日,英伟达宣布向Ilya Sutskever创办的Safe Superintelligence(SSI)投资约50亿美元——这是本轮AI热潮中规模最大的单笔股权投资之一。作为交换,SSI将获得英伟达下一代Vera Rubin平台的使用权。这笔交易的特殊之处在于:SSI至今没有公开发布任何产品,也未发表过任何公开研究论文。 为什么一家"零产出"的AI公司能获得50亿美元估值?为什么英伟达愿意用下一代旗舰计算平台作为 …
MCP协议2026-07-28版本无状态架构重大升级深度解析:Anthropic Model Context Protocol史上最大架构修订
Wednesday, July 29, 2026 在 博客
一、引言:MCP协议的历史性转折 2026年7月28日,Anthropic主导的Model Context Protocol(MCP)正式发布2026-07-28版本规范——这是该协议自诞生以来最大的一次架构修订。核心变更将协议从有状态会话彻底转为无状态架构,移除了initialize握手和Mcp-Session-Id请求头。 这一变更的影响远超表面看来"只是去掉了一个握手步骤"。它从根本上改变了MCP服务器的部署方式、负载均衡策略和网关架构,使得企业可以在不引入粘性会话路由 …