跳到正文
10月7日周三
  1. arXiv cs.AI22

    边缘端智能数据模型分类的小语言模型:一种成本感知的混合方法

    研究评估轻量级开源语言模型在资源受限的边缘环境下,将输入数据实体匹配到最合适的智能数据模型(SDM)的表现,系统基准测试了通用、推理专用和代码专用三类架构在多个领域数据集上的效果。实验还将所调研的大语言模型与 TF-IDF 和轻量级句子编码器两种近零成本相似度基线在同一任务上对比,为判断 LLM 分类在边缘平台的实际价值提供参考。

  2. arXiv cs.AI24

    CuratorMAS:通过多智能体编排实现数据集自动策展

    CuratorMAS 是一个多智能体协作框架,将数据集策展拆解为五个可编程执行阶段并组成可并行工作流,通过数据集探索、在线领域知识检索、评估标准推导与指标计算、过滤及技能进化模块完成自动策展。实验显示,该框架将噪声率最多降低 36.03 个百分点,下游模型 F1 分数最多提升 8.88 个百分点。

  3. arXiv cs.AI24

    无需重训即可修正物理违规:Boltz-2 与 OpenFold-3 的推理时投影方法

    针对 AlphaFold 3 类共折叠模型输出中链间原子重叠、配体键长键角失真、环不共面及手性反转等物理违规问题,研究者提出两种闭式投影算子,直接作用于扩散模型去噪后的干净坐标估计 x̂₀:链间范德华投影推开冲突最严重的原子对,配体距离几何投影恢复键长、键角、内部接触、共面性与手性。

  4. arXiv cs.AI24

    MOTIVE:面向视觉语言模型的多视角自验证与可靠性引导重思考框架

    针对视觉语言模型自验证依赖单一标准或固定提示词、可靠性评估不完整的问题,研究者提出 MOTIVE 多视角自验证框架,通过正确性对齐的多视角验证学习为每个候选答案打分。推理时该分数决定直接采纳还是触发历史引导的重思考,在多种多模态基准和 VLM 主干上持续优于强自验证与自纠正基线,并减少不必要的推理轮次。

  5. arXiv cs.AI22

    TopoPlanner:面向 LLM 智能体的拓扑一致任务规划框架

    TopoPlanner 将工具依赖图提升为 cellular workflow complexes,作为拓扑感知上下文供 LLM 进行工具规划,通过 cosheaf 一致检索获取请求相关的闭合子复形,并对检索到的拓扑做多维结构推理后生成工具序列。在四个工具规划基准上,针对 loop、merge 及 loop-merge 工作流,该方法在不同本地 LLM 骨干上均优于基于提示词和图增强的基线。

  6. arXiv cs.AI34

    EPOCH:通过证据治理搜索实现可靠发现

    EPOCH 是一种证据治理架构,通过显式任务契约、类型化记忆、主动证伪、准入检查和独立重放构建发现循环,让每个候选方案按其支撑主张的强度与范围接受评估。它在 AlgoTune 上取得 SOTA 聚合表现,平均归一化得分 0.65 对最强基线 0.53,并在内部 Math14 套件上取得最高平均分 0.57。在十个发现问题上,EPOCH 产出可执行构造、优化算法、反例和带证明支持的结果。

  7. arXiv cs.AI31

    SAGA:通过知识抽象实现 LLM 智能体自我进化

    针对 LLM 智能体难以从经验中持续进化的问题,研究者提出 SAGA 框架,将交互轨迹逐步抽象为情景描述、可复用流程和带明确适用条件的原理,并保留与执行证据的关联。检索到的原理会被实例化为任务专属指导,通过纠正反馈与重采样优化候选动作,形成执行—抽象反馈闭环。在 ScienceWorld 和 ALFWorld 上的实验显示任务表现提升,消融研究验证了上下文实例化与动作调控对利用原理级知识的重要性。

  8. arXiv cs.AI22

    视觉 Transformer 如何通过转喻回路为抽象概念奠基

    研究揭示 Vision Transformer 通过"转喻式奠基"机制识别抽象概念:在 CLIP 和 DINO 视觉编码器上应用 Transcoders 后发现,抽象预测由"火"等具体可解释的锚概念驱动,感知原语主导浅层、类物体锚点先于抽象目标出现,含渲染文字的图像则走独立的感知到文本路径。因果干预实验验证这些转喻中间特征确实参与抽象概念奠基。该成果发表于 EMNLP 2026 主会。

  9. arXiv cs.AI36

    GameGo:用真实资产锚定的合成轨迹训练游戏开发智能体

    研究团队提出 GameGo 框架,将简短游戏创意系统化转化为基于行业实践的产品需求文档,并构建了覆盖 2D、2.5D、3D 游戏的 55,060 条开发轨迹数据集 GameGoData 及含 124 个游戏查询的 GameGoBench。基于该数据训练的 GameGoCoder 在游戏开发基准上超越同类基线,性能接近前沿模型。代码、数据集与模型将全部公开。

  10. 掘金45

    当 Spec 遇见遗留系统:用 LangGraph 构建带人工审核节点的长任务 Agent

    一次用 LangGraph 把"写 Spec、生成、验证、人工把关"落成真实系统的实践:流程拆成 Spec 构建、代码生成、自动验证、风险分级人审、部署上线五个阶段,构成可暂停、可恢复的状态机。高风险改动才暂停等待人工批准,checkpointer 把状态持久化到数据库,进程可安全退出后由外部轮询器从暂停点唤醒。作者强调重试与重新规划必须分开处理,并给重新规划设上限,避免循环空转。

  11. 掘金27

    一句“帮我看看我基金组合”,怎样走过 ETF Agent 的六层系统

    ETF Agent 用六层系统处理“我的组合主要暴露在哪些行业”这类提问:从会话与请求身份、入口决策、原生研究循环,到统一 Projector 装配模型输入,再经工具执行、证据计算、正文交付与 Langfuse 观测。系统将消息身份与运行身份分开管理,同一消息重发复用原运行,正文冲突则拒绝覆盖已有执行。

  12. 量子位85

    OpenAI 公开 722 篇数学手稿,覆盖准黎曼猜想与 BSD 等难题

    OpenAI 公开 722 篇数学手稿,归为 372 组结果,出自一个尚未发布的内部模型,论文、源码和部分 Lean 证明已上传 GitHub。内容涉及准黎曼猜想、霍奇猜想、BSD 猜想、π 的无理性指数等,模型此前尝试约 4000 个研究问题,平均每项结果算力约相当于 ChatGPT Pro 思考 3 小时。

    推荐理由:OpenAI 一次性公开 722 篇数学手稿,读者可了解其覆盖范围与数学界对核验进度的保留态度。

  13. 掘金22

    NapCat 接入 QQ 机器人反复掉线排查:根因是守护脚本抢 Token

    用 NapCat 把 QQ 接入自动化系统时反复掉线,排查二十来次后发现主因不是网络或腾讯风控,而是自己挂的守护脚本偷偷拉起桌面注入版,抢走 Shell 无头模式的登录 Token。作者在 Windows 11 + NapCat Shell + QQ 9.9.33-52230 环境下给出端口与日志交叉验证、失败熔断、进程树清理等加固方案,并称文末附有彻底断根的「终极重构版」。

  14. 掘金50

    给 AI 助手加能力,规则文件和 Skill 到底该用哪个?

    针对 Roo Code / Cursor / Claude Code 等 AI 助手,作者提出「意图 vs 执行」双层模型:规则文件管「什么时候、必须做什么」,Skill 管「具体怎么做」。实测把所有规范塞进 rules 会让系统提示词涨到 3000+ Token,抽离执行逻辑后 rules 可瘦身到 200 Token 左右,并避免「Lost in the Middle」导致的注意力失焦。

  15. 掘金12

    古代没有程序员,但蒲松龄们早就被"裁员"过了

    一位写了近十年代码的程序员从古籍中梳理出被时代冲击者的三种结局:卢德分子砸织机、镖师转型、蒲松龄落第后写出《聊斋志异》。他借此对照 AI 写代码对程序员的冲击,认为 AI 替代的是"把需求翻译成代码"的动作,而非判断该做什么的能力,并选择把这场对峙本身做成作品。

  16. 掘金34

    AI 复盘技能从 49 分钟压到 43 秒:主流程洁癖与时间盒三纪律实战

    一次晨间复盘技能跑了 49 分钟,作者当场定下 5 分钟硬上限,把 kb 推送、钉钉修复等非主流程活甩出主线,并用 tools/jihua_collect.py 一条命令并行抓完八项数据源,实测全链 43 秒。其中 collector 抓数 0.4 秒,判断加写盘约 40 秒,kb 收尾 8.5 秒转入后台不阻塞主流程。