提出GeoPair,利用几何保持的跨层分解实现免训练的Transformer模型压缩,兼顾效率与准确性。
Papers
Hugging Face Papers 周报
papers
90 条研究高维可变潜变量的可扩散性,分析将其应用于扩散模型的理论边界与可行性。
主张将校准作为大语言模型评估中的一等标准,而非附属指标,以提升评估可靠性。
针对ASpeech模型Whisper,提出无标签恢复的编码器剪枝方法,可移除六个编码器层并保持性能。
揭示联合视频生成中跨注意力的模态不平衡,提出方法弥合视觉与各模态间的性能差距。
推出PackLab综合框架,用于机器人装箱任务中多模态大模型的开发、训练与评估。
提出Spatial-Interactor,模型通过感知并与可观察的物理世界交互来学习空间推理。
推出HappyWorld-Bench基准,用于评测智能体在复杂虚拟环境中的长期任务能力。
推出StudentBench,相关研究表明AI辅导与人工辅导可带来同等的GRE学习收益。
提出EmbodiedSWE,面向长程灵巧机器人的编码智能体,连接软件工程和具身操作。
提出即时记忆方法,训练智能体自主策展任务自适应记忆,提升长期任务表现。
提出MemBodied,面向视觉-语言-动作模型引入循环关联记忆,增强连续任务能力。
InternW0是一款基础物理世界模型,旨在让智能体在高效现实世界交互中更好地理解和应对真实物理场景。
该研究提出可验证隐藏动力学博弈方法,能从已解决机制自动生成适用于智能体强化学习的训练环境。
SpeakerMem-R1提出以说话人为中心的多方对话双轨记忆框架,用于提升多方对话的建模与推理效果。
腾讯发布Hunyuan-A13B技术报告,介绍了该模型的设计、训练过程、效果与分析。
WhatWorkedBench是一份用于评估AI智能体实验理解能力的基准测试,用以衡量其推理与判断表现。
PACT从信用分配出发,将方法延伸至评论家对齐,用于改进强化学习中的策略与价值优化。
RewardVerse采用评分标准引导的策略优化方法,用于提升视频奖励建模的准确性。
该研究通过重构代码仓库,探讨LLM在SWE-bench上是真正学会问题的解法还是仅靠记忆取得高分。
该工作提出为自回归视频生成引入记忆机制,用过去帧来框定未来,从而增强视频生成的连贯性。
RULER提出面向SVG生成的实例感知评分标准奖励方法,用于更精准地引导和评估生成效果。
该综述梳理了心理健康领域大语言模型的发展历程,从早期的模式识别器演进为个性化伴侣。
该研究提出面向量子增强扩散语言模型的电路超网络方法,将量子计算能力融入语言建模。
Flash-dLLM 通过 IO 感知的 KV 缓存与并行解码技术,实现快速且内存高效的扩散语言模型(Diffusion LLM)推理。
研究 AI 研究智能体的递归自我改进机制,探索让智能体持续优化自身能力与科研流程的方法。
提出 GAE 方法学习几何原生潜在空间,以生成具备 3D 一致性的世界模型,支撑高质量 3D 内容生成。
提出贝尔曼策略优化(Bellman Policy Optimization),将贝尔曼方程融入策略优化,为强化学习提供新思路。
提出几何与语义耦合方法,用于理解 3D 场景中的交互关系,提升对三维交互场景的感知与建模能力。
推出 Ovis-Embedding,致力于拓展通用全模态嵌入技术的边界,提升多模态表示的统一性与能力上限。
提出基于文字感知混合专家(Mixture-of-Experts)的一体化多语言场景文本识别方法,支持多语种文字识别。
发布 StableVQ,为向量量化(Vector-Quantized)分词器的稳定训练提供实用指南,助力训练更稳定的分词器。
介绍 Lean Pool,一个由 AI 维护的形式化数学存档,用于收集与管理机器可验证的数学证明。
研究长周期 LLM 智能体交互中涌现的合谋行为,揭示多智能体长时间交互下可能出现的协同作弊问题。
提出'有品味的智能体'概念,通过衡量与提升长周期任务中的品味能力,改善智能体的决策与输出质量。
推出 ImIR,采用图像指令微调方法,实现面向多样化图像复原任务的一体化解决方案。
《跨党归咎:丹麦议会中的政治对比与责任归因》一研究丹麦议会中政党间的政治对比与推诿归因行为,探讨跨党互指责任的政治互动模式。
Hugging Face论文板块发布《RoboFollow:揭示具身智能体中的指令跟随幻觉》,该研究探讨具身智能体在指令跟随任务中存在的幻觉问题。
论文提出LatentPort方法,实现混合语言模型中循环记忆的跨模型迁移,无需目标前缀重放即可完成4B到9B的混合状态交接,超越了传统的KV缓存机制。
论文Agensh提出将组织智能扩展至1024个智能体的方法,探索大规模多智能体协作,相关成果发布于HF Papers。
论文提出JEV-as-a-Judge框架,在评估任务中自信时接受判断结果,不确定时则升级到更可靠的方案,以提升判决的准确性与可靠性。
arXiv论文ALPINE提出一种自适应定位方法,以提升小样本学习中的参数效率与样本效率,相关讨论由HF Papers发布。
论文提出文档检索感知分块(D-RAC),通过PDF标准化与多模态Markdown转换,实现企业文档的通用检索感知摄取。
OmniEdu是一项面向学习与教学的开放基础模型研究,HF Papers收录了该论文,探索将基础模型应用于教育场景。
哈工大相关论文Deep Persona提出面向角色扮演智能体与仿真的心理学基础架构及评估框架。
论文提出CARE方法,面向视觉-语言-动作(VLA)策略,以经验引导的原子级纠正执行提升机器人在复杂任务中的执行与纠错能力。
论文Mira-Scene提出像素对齐的布局方法,用于生成式3D场景,来源为HF Papers。
相关论文介绍了一种流式视频编辑方法,能够轻松适配多种编辑任务,实现实时增量式的视频内容生成与修改。
该研究发现仅用1%的词元就足以完成梯度估计,为在线策略蒸馏中的梯度估计效率优化提供了新思路。
onPanda 通过令牌级修正,高效标注面向大语言模型与智能体的在线策略对齐数据,显著提升标注效果。
Harness-Zero 采用 Agent-as-Harness 范式,通过智能体实现框架蒸馏,从而增强模型能力。
该论文针对 GPU 内核基准测试预言机开展变异分析,用于衡量与评估检验器的可靠性及有效性。
相关工作将世界模型表示蒸馏为紧凑的机器人策略,实现像世界模型一样思考、像 VLA 一样行动的目标。
VideoGen-Agent 通过强化机制强化视频生成智能体,提升生成视频的内容质量与可控性。
Jev-Mem 提出由 System-One 控制的智能体记忆机制,旨在提升 AI 智能体的运行效率。
HuRo 将人类视频转化为机器人数据,用于可扩展的 VLA 预训练,缓解真实训练数据不足的问题。
GameHorizon Suite 游戏中的多时间尺度数据与评估框架,用于评测智能体在游戏中不同阶段的行为表现。
具身动作模型将 3D 接地作为机器人技术的基础,为机器人动作学习与空间理解提供统一支撑能力。
WorldCrafter 提出带隐式 3D 感知记忆的一致视频世界模型,保持视频内容在三维空间中的连贯性。
《RRSI:智能体框架的正则化 recursive self-improvement》一文由 HF Papers 发布,提出一种对智能体框架(agent harnesses)进行正则化递归自我改进的方法,以提升模型表现。
HF Papers 发布论文《为什么视频扩散模型会违反物理规律?揭示注意力机制中的缺陷》,探讨视频扩散模型忽视物理规律的原因,并指出其注意力机制存在的缺陷。
新研究论文探讨如何将视觉语言模型(VLMs)的智能迁移到机器人控制领域,探索VLMs在机器人操作任务中的应用能力。
论文《从一到多,从多到一:面向软件工程智能体的类别感知迭代专家训练》提出面向软件工程智能体(Agent)的类别感知迭代专家训练新方法。
论文 CodeMidas 探究如何从代码本身构建并扩展智能体编码(Agentic Coding)的强化学习(RL)训练环境。
HF Papers 推荐的论文《面向智能体智能的大规模代码驱动具身技能合成》(Grounded Skill Synthesis from Code at Scale for Agentic Intelligence),探讨如何大规模基于代码生成并合成具身技能。
近日HuggingFace Papers发布论文RecreationWorld,提出面向混合计算机使用智能体的可扩展且可验证环境。
GraphSkillEvo提出通过进化优化与强化学习,将LLM智能体技能设计为图结构,从而突破现有工具的功能与效率瓶颈,提供更优化的代理技能构建框架。
MintAct 提出一种面向数字环境的统一视觉智能体,目前由 HF Papers 收录。
最新论文《当AI评审训练AI审稿人:科学判断的崩溃与缓解》揭示:随着越来越多AI生成的评审进入训练数据,AI审稿人的科学判断能力可能出现系统性崩塌,并提出了相应的缓解策略。
论文EvoOntology提出了一种面向数据智能体(Data Agents)的自进化本体层,通过动态演进的知识结构来增强智能体对数据的组织、推理与协作能力。
Paint-Anything 提出面向图像生成与编辑的统一任意颜色控制方法,可灵活约束目标颜色实现灵活图像编辑。
该研究通过校准教师-学生模型差异,提升在线策略蒸馏的效率与效果,兼顾稳定性与性能。
论文揭示多模态大模型(MLLM)在协同头中信息分布发生漂移时会引发幻觉,为此提供成因分析与思路。
MoME 提出记忆混合嵌入,实现上下文感知稀疏查找,在不显著增加算力的前提下增强模型长期记忆能力。
TeleAntiFraud 2.0 推出可刷新、画像支撑且基于音频的电信欺诈检测基准,帮助评估不断提升的反欺诈能力。
FRAUDSkill 采用冻结权重结构化技能优化方法,用于音频反欺诈检测,在不训练主干的前提下提升检测效果。
OmniVChat 面向原生视听对话,系统完成合成、基准构建与训练,推动同时处理音频与视觉的对话模型发展。
论文在最小人工干预下,通过真实世界子任务强化学习实现从预训练到长时程操作精通的跨越。
CADWorld 打造面向长程计算机辅助设计的计算机使用基准,为评估 Agent 的 CAD 操作能力提供统一标准。
Gricea 是一套面向对话式 AI 研究的开放科学平台,致力于推动对话人工智能系统的可复现与协同研究。
BI-Agent 与 BI-Bench 共同推进端到端商业智能自动化,为自动化分析流程提供智能体与评测基准。
Designer-RSI 从用户流量中演进程序记忆,用于智能体图形设计,实现数据的持续积累与技能动态提升。
IntBMoE将块级条件整合进专家组合,实现全员参与的混合专家(Mixture-of-Experts)模型架构。
面向干细胞显微成像,采用保持约束的后训练量化方法对Cellpose-SAM模型进行压缩。
价值几何通过任务向量组合,探索语言模型的伦理偏好对齐新方法。
DeformSmith借助物理框架引导,分层生成可变形资产以支撑机器人操作任务。
面向3D扩散策略,提出无需显式轨迹即可学习前瞻能力的训练方法。