暂无搜索历史
💡 一句话总结:AutoDesign 把「围绕模型的那套系统」(prompt、工具、流程)变成可被 Agent 自动优化的对象——外层循环改系统、内层循环出作品...
💡 一句话总结:DreamX-Phi 1.0 用"把每条手臂的 3D 运动轨迹直接钉进注意力机制"的几何化方式,解决视频世界模型"画面很真、动作不听"的老毛病,...
💡 一句话总结:DeepSeek V4-Pro 旗舰模型今天正式 GA,Agent 能力据报暴涨(DeepSWE 从 12.8 飙到 62.7),价格比 Cla...
💡 一句话总结:Grok 4.6 在智能指数上追平了 GPT-5.6 Sol(都 61 分),token 价格只有一半——但真正让人意外的是它的回合效率(完成 ...
💡 一句话总结:Meta 用 Apache 2.0 放了一个 30B、单卡能跑、冲着本地 agent 去的模型——官方跑分漂亮、生态一天内就跟上,但蒸馏来源不透...
大语言模型基本上是一摞结构几乎相同的 Transformer 层——每一层都是注意力 + MLP,参数化的方式高度一致。所以你在任意一层插 LoRA,行为都是可...
💡 一句话总结:抖音搜索团队提出 DME,用"隐式 latent reasoning + 跨条件重建"两个训练期机制,让多模态嵌入在不增加推理延迟的前提下既快又...
💡 一句话总结:FlowPilot 把"预测未来看到的画面"和"生成飞行轨迹"塞进同一个生成式模型,让两条流互相参考——部署时只取轨迹、不解码画面。配合一个数学...
💡 一句话总结:MiniMax H3 是个 33B 的全模态视频生成模型(不是语言模型),7 月底预告、8 月初开放了 H3-Base 权重;但「开源」指的是基...
💡 一句话总结:Q-CueGraph 把多模态大模型"看哪里"的决策拎出来,做成一个独立、可审计的坐标级策略,在冻结的 Qwen2.5-VL 上用 19% 的画...
💡 一句话总结:把题目从文本挪进图片,主流多模态大模型几乎全军覆没(24 个组合全掉分,平均 17.8 分),而它们常常能正确"读"出题目却不照它作答——这篇论...
💡 一句话总结:TrajDebug 把"agent 失败了找哪步错"拆成三步——先找局部错误、再判它被没被修好/留没留痕、最后在小范围里归因;在 7 个 age...
暂未填写公司和职称
暂未填写个人简介
暂未填写技能专长
暂未填写学校和专业
暂未填写个人网址
暂未填写所在城市