暂无搜索历史
💡 一句话总结:AutoDesign 把「围绕模型的那套系统」(prompt、工具、流程)变成可被 Agent 自动优化的对象——外层循环改系统、内层循环出作品...
💡 一句话总结:DreamX-Phi 1.0 用"把每条手臂的 3D 运动轨迹直接钉进注意力机制"的几何化方式,解决视频世界模型"画面很真、动作不听"的老毛病,...
💡 一句话总结:DeepSeek V4-Pro 旗舰模型今天正式 GA,Agent 能力据报暴涨(DeepSWE 从 12.8 飙到 62.7),价格比 Cla...
💡 一句话总结:Grok 4.6 在智能指数上追平了 GPT-5.6 Sol(都 61 分),token 价格只有一半——但真正让人意外的是它的回合效率(完成 ...
💡 一句话总结:Meta 用 Apache 2.0 放了一个 30B、单卡能跑、冲着本地 agent 去的模型——官方跑分漂亮、生态一天内就跟上,但蒸馏来源不透...
大语言模型基本上是一摞结构几乎相同的 Transformer 层——每一层都是注意力 + MLP,参数化的方式高度一致。所以你在任意一层插 LoRA,行为都是可...
💡 一句话总结:抖音搜索团队提出 DME,用"隐式 latent reasoning + 跨条件重建"两个训练期机制,让多模态嵌入在不增加推理延迟的前提下既快又...
💡 一句话总结:FlowPilot 把"预测未来看到的画面"和"生成飞行轨迹"塞进同一个生成式模型,让两条流互相参考——部署时只取轨迹、不解码画面。配合一个数学...
💡 一句话总结:MiniMax H3 是个 33B 的全模态视频生成模型(不是语言模型),7 月底预告、8 月初开放了 H3-Base 权重;但「开源」指的是基...
💡 一句话总结:Q-CueGraph 把多模态大模型"看哪里"的决策拎出来,做成一个独立、可审计的坐标级策略,在冻结的 Qwen2.5-VL 上用 19% 的画...
💡 一句话总结:把题目从文本挪进图片,主流多模态大模型几乎全军覆没(24 个组合全掉分,平均 17.8 分),而它们常常能正确"读"出题目却不照它作答——这篇论...
💡 一句话总结:TrajDebug 把"agent 失败了找哪步错"拆成三步——先找局部错误、再判它被没被修好/留没留痕、最后在小范围里归因;在 7 个 age...
💡 一句话总结:ConfBench 用受控退化造出一份「低精度区」基准,首次系统测出 VLM 在文档提取时自报的置信度能不能信,还给了 ECARB 这个能直接算...
💡 一句话总结:PaDoc 把端到端文档解析的解码图从「一条长链」改成「布局串行规划 + 各区域内容并发生成」的分支树,靠祖先注意(ancestral atte...
💡 一句话带走:Skill-α 把 agent skill 的生成变成"一步步改",用 rollback reward(编辑前后在同一任务上跑一遍对比)给每次编...
💡 一句话带走:字节 2026 年 8 月的技术报告 SwanTale 用一套统一框架(SwanVAE 连续 latent + Flow-matching Tr...
💡 一句话带走:AWS 的 IDP AutoOpt 派一个跑在闭环里的 LLM agent(评分 → 逐字段诊断错误 → 改配置 → 重评),把一整条文档处理流...
💡 一句话带走:Infinity-Parser2 把"可控数据合成 + 多任务联合强化学习"拧成一个端到端文档解析大模型,开源 500 万双语数据和两个模型,给...
代码:https://github.com/run-llama/ExtractBench
这篇论文用 "MLLM 当 corrector、衡量 OCR 原始输出与校正后输出的差异" 的思路,提出一个无需人工标注的 OCR 引擎选择框架 DocOCR-...
暂未填写公司和职称
暂未填写个人简介
暂未填写技能专长
暂未填写学校和专业
暂未填写个人网址
暂未填写所在城市