宝宝学识屋「学中文」栏目:AI 联想图 + 笔顺动画教孩子认字
宝宝学识屋上线「学中文」栏目,把每个汉字拆成发音、AI 联想图、笔顺动画与测试、AI 词组和成语音频来教。字库收录 2488 个字、两万四千多条成语,含「中」的成语有 173 个。支持按年级、笔画顺序、拼音三种学法,免费免注册,手机电脑均可打开。
宝宝学识屋上线「学中文」栏目,把每个汉字拆成发音、AI 联想图、笔顺动画与测试、AI 词组和成语音频来教。字库收录 2488 个字、两万四千多条成语,含「中」的成语有 173 个。支持按年级、笔画顺序、拼音三种学法,免费免注册,手机电脑均可打开。
据 Bloomberg 援引知情人士报道,DeepSeek 接近完成至少 800 亿元(约 120 亿美元)融资,高于原定约 500 亿元的目标,由腾讯与宁德时代领投,最终金额可能逼近 1000 亿元。资金将用于扩大算力基础设施、加速模型研发与团队建设,公司计划 2027 年初启动科创板 IPO,中信证券已担任上市辅导机构。DeepSeek 方面未公开确认,融资细节仍可能在最后谈判中调整。
即时通讯的核心是让不可靠、可离线的多端与服务端就"发生了哪些事、以什么顺序"达成一致,集合与序需分别保证。消息经幂等键去重、分配 seq 定序后落库投递,ACK 仅表示已受理,服务端回显才确认发送成功。同步侧通过会话链与收件箱游标实现跨会话增量拉取,写扩散适合单聊小群,读扩散适合超大群与聊天室。
作者以蔓藤AI 数字人创作平台的通用 AI 助手为例,讲搭建 Agent 系统的方法论与理想形态。该系统把循环放在服务端,一次用户发言最多 4 轮、每轮落一条记录,用冻结按上限、结算释放整笔加实扣的计费模型,并通过 SSE 六事件契约向浏览器推送过程。文中还列出十二个真实踩过的坑,包括提示词与工具表分家、中断导致悬空 tool_calls、空流被当成功、回调不校验归属等。
作者提出判断 Workflow 与 Agent 的核心标准是下一步由谁决定:开发者提前定义就是 Workflow,模型运行时决定才是 Agent,并给出拔掉大模型测试来验证。
treg 发布一个面向智能体工具的统一注册表,用一个 base URL 和一个 token 即可调用覆盖 SEO、社交趋势、企业与人物信息、广告、抓取、图像与视频生成等数千个端点,按次计费、最低一分钱起,无需向各供应商注册。
nanoMuse 发布开源个人智能体,手机、桌面、Web 控制台和连接它们的中继都在同一仓库,采用 GPL-3.0-or-later 许可,最新版本 0.1.40。
作者实测 GitHub Trending 上的 e2e 测试框架(tester-army/e2e),其 agent 步骤验证通过后会被录制,第二次运行直接回放,实测零模型调用、耗时从 3.48 秒降到 309 毫秒。
文章梳理了 2026 年 AI 工程圈新词 Harness Engineering(驾驭工程),其核心公式为 Agent = Model + Harness,即模型之外的系统提示词、工具调用、沙箱环境、编排逻辑、记忆机制与反馈回路等一切。
Simon Willison 发布 llm-openai-decisions 0.1a0 插件,用于调用 OpenAI 在 DevDay 后推出的 Jev 风格 Decisions API。
Jake Boggan 在 Hacker News 评论 openai/math 相关讨论时表示,自己曾为 Barnette 猜想投入 24 年、数千小时,去年夏天还一度以为已解决,如今该问题(problem 180)据称已被证明。他说听到这一消息有种遥远的悲伤,像得知前女友突然车祸去世,并猜测今晚很多人会有类似的复杂情绪。
开源项目 DeskWorlds 的桌面版仅支持 macOS,作者用 ZCode 拆解后发现鱼缸场景本身是运行在浏览器里的 Three.js + WebGL2 3D 世界,与 macOS 绑定的只是最外层壁纸宿主。
SymNetPro 在 SymNet 的双任务无线电地图重建与定位骨干上新增两个组件:稀疏 LOS 感知注意力偏置和发射机丢弃增强,用于从稀疏接收功率观测中定位多个定向发射机。在定向射线追踪城市环境实验中,其 OSPA 在极端稀疏采样下显著低于代表性定位基线,并在测量噪声和发射机数量增加时保持稳定增益。代码、数据集和模型检查点已公开。
研究团队提出 VLAct,一种面向 VLA 模型的 VLM 骨干,通过 VLM 先验保持、多头连续动作协同监督和部分统一的跨具身动作布局,在广泛异构多具身机器人数据上进行持续预训练。
研究者提出 VT-MUSE,一个面向视触觉操作任务的多模态统一序列表征学习框架,通过两阶段学习解决视觉与触觉独立编码及忽略接触时序演化的问题。在仿真基准上,VT-MUSE 在所有任务上超越最强基线 11 个百分点,真实世界实验也取得显著提升。
DexPIE 是一个从真实部署经验中提升灵巧操作策略的后训练框架,通过适配灵巧手干预系统和多阶段 DAgger 式数据采集实现有效探索覆盖。在三个真实世界灵巧操作任务上,DexPIE 相比基于演示的参考策略成功率提升 37.3%,优于所有基线方法。源代码和数据集将公开。
HRDexDB 是一个真实世界 4D 灵巧抓取数据集,覆盖五种本体、100 个物体、3.2K 次试验,记录 3D 手-物交互轨迹随时间的变化。它通过同步多相机系统和重建流程提供多视角与第一视角 RGB 观测、3D 手部几何、机器人状态、物体 6D 位姿轨迹及成功/失败标注。该数据集已用于人到机器人接触图迁移、视觉机器人-物体接触估计和检索辅助抓取。
ChronoWorld 提出"观测—状态—反射"框架,利用时空因果线索与重建先验生成全局一致的自由视角 4D 场景。其 Spatiotemporal Epipolar Causal Attention 机制在生成全程施加多视角对极约束与时间因果性,并配合重建驱动的几何反射管线与 4D 检索策略实现动态自评估与修正。实验显示该方法在时空一致的电影级 4D 场景生成上达到 SOTA。
研究提出多任务条件生成对抗网络 MT-cGAN,可直接从 qMRI 回波图像合成类 DESS 图像并分割膝关节软骨与半月板。在 361 名受试者共 508 例膝关节 MRI 数据上,其平均 Dice 达 0.84,优于结合迁移学习的 SOTA 条件 GAN(0.82,p<0.001),T1ρ 与 T2 量化变异系数最低,分别为 1.84% 和 1.81%。
LoDEOT 用五维偏移 token 替代高维实例 token 来预测屋顶到轮廓偏移(RFO),在保留高维实例 token 做检测与分割的同时,将实例 token、浓度门控屋顶和框掩码证据映射为五维偏移 token,再经独立二维读出。在 BONAI 数据集上,其 FAP50 达 54.58、mEPE 为 5.23 像素,FAP50 比所评估的端到端基线高出 7.56-16.85 个百分点。
SteadySplats 通过基于历史的空间重采样与时间重要性重采样,在随机渲染中大幅加速图像收敛并保证相机运动下的连贯性;训练阶段的颜色正则项则隐式降低 3DGS 模型沿视线方向的方差。其基于 Vulkan 的渲染器在每像素 1 采样下较此前随机方法提升约 13 dB PSNR,并快速收敛至排序 3DGS,平均 L1 误差低于 10^-4。
研究提出 SCAI SCI Gait 数据集,包含 239 名脊髓损伤成人的同步视频、动作捕捉与测力台数据,通过单目矢状面视频拟合参数化人体网格并驱动 OpenSim 模型。
CNP-Flow 是一个通过流反转学习条件源分布的时间生成流匹配框架,用条件噪声预测器(CNP)为每个时间条件生成各向同性高斯源,替代标准条件流匹配从标准高斯采样的做法。
VolS-GS 是一个可重光照的 Gaussian Splatting 框架,通过将高斯场景的空间支撑作为可微有限体积传输求解器的域,让光线在物体内部传播,从而建模次表面散射等非局部效应。该框架用小型网络为每个 Gaussian 预测散射与吸收系数,并在三个 OLAT 基准上持续提升新光照与新视角下的重光照质量。
DiDE 是首个面向解耦式 3D 风格化(Disen3D)的免训练框架,可将颜色与纹理独立迁移到生成的 3D 资产上。它利用图像到 3D 模型潜空间中纹理仅占少量风格通道的特性,通过通道划分机制分别处理内容图、纹理参考和颜色参考,并在每个自注意力层无干扰地组合两种风格信号。
一篇综述从场景表示、时序建模、重建流程与优化目标四个维度统一梳理 4D 场景重建方法,涵盖 NeRF 与 3D Gaussian Splatting 等路线。该框架分析了不同设计选择对几何保真度、外观一致性、运动表示与计算效率的影响,并整理了常用数据集与评测指标,指出当前实验实践的局限与开放挑战。相关论文与资源集合持续更新。
TripleFlow 是一个无需训练的视频对象移除框架,通过协调源流、残差流与合成流,将擦除与生成紧密耦合。它复用单次目标预测,由残差流抑制对象、合成流独立重建被遮挡背景,并在每一步将合成背景注入编辑轨迹。在五个基准上,TripleFlow 在重建保真度与时间一致性上均显著优于现有基线,达到新的 SOTA。
研究者提出 MeshOctave,通过二进空间网格分辨率定义尺度,将网格粗化视为体素单元内顶点合并的确定性坍缩,并用 split-and-rewire 逆操作逐面确定八分体子顶点与局部连接,无需序列化即可并行生成。该方法采用尺度条件掩码均匀离散扩散模型学习该操作,在几何保真度与拓扑有效性上大幅超越强基线,并支持自适应分辨率细化与网格细分任务。
SEGUE 是一个让流式视频生成器忠实执行中流提示词切换过渡的新框架:每次切换时由免训练规划器解析最新帧与提示词,写入带角色和时长的 segue prompts 后再交还用户提示词。
研究者提出轨迹对齐字形渲染参考与深度归一化识别器特征监督,解决视频扩散模型难以复现精确笔画结构、易生成乱码字符的问题。同时构建 VTEdit 基准,包含 288 个真实场景片段和 440 条标注文本轨迹,覆盖文本替换与添加任务。实验显示该方法在文本准确率和背景保持上优于图像文本编辑方法、视频编辑方法及商业模型,句子准确率达 0.9408,并在用户研究中获得最高偏好。
研究者提出 Residual Patch Adapter(RPA),一种轻量模块化适配器,利用 ViT 视觉编码器中间层的全部 patch token 进行对齐,在 THINGS-EEG2 上取得被试内 95.4%、跨被试 35.5% 的 Top-1 准确率,在 THINGS-MEG 上分别为 65.2% 和 6.7%,两个数据集均达 SOTA。
WeaveAgent 是一个两阶段工具路由智能体,将路由与视觉感知解耦,先训练模型主动发出工具调用,再按查询类型条件执行。对齐 SFT 将外部工具路由从 0% 提升至 80.75%(323/400),GRPO 抑制了 9 次内部误触发且工具选择不变。
HARMONY 是一个分层链式思维框架,结合智能体推理与视觉几何基础模型,从单张室内场景图像重建完整 3D 场景。它先校准相机建立语义空间框架,再按墙面元素、独立家具、家具上装饰物的分层顺序放置物体,并用深度优先遍历和反思反馈循环避免误差累积。实验表明 HARMONY 在合成与真实图像上优于所评估的重建基线,与 GPT-6 Astra 的定性对比显示其物体布局更忠实、场景细节保留更好。
研究用 CHASE DB1 全部 28 张图像和两位人类标注,考察视网膜血管分割中阈值选择对评估结果的影响。固定七折协议保持 14 名受试者双眼同折,随机森林与 Extra Trees 对观察者 1 拟合三个随机种子共 42 次。
针对重建 FID(rFID)与生成 FID(gFID)相关性弱甚至为负的问题,研究者提出生成感知重建(GAR),通过向编码器 latent 加噪并经生成模型去噪,构建从重建到生成的连续轨迹。基于该轨迹的诊断指标 GAR-FID 在多种 tokenizer 和规模下与 gFID 强相关,且中间 GAR latent 保留与源图像的配对监督,可用于解码器适配,在不同模型规模上持续提升生成质量。
PointZero 提出以 3D 点轨迹补全作为预训练目标,无需机器人动作标签即可学习可迁移的 3D 动态先验。研究团队构建了包含 290 万合成帧、覆盖可变形、铰接与刚性物体的数据集,并训练出基于 Transformer 的 PointZero,在相同数据上优于此前方法。
RIGOR 是一个面向重力对齐全景视频的大规模三维重建管线,保留冻结的前馈透视骨干网络,将每张全景图当作四视角虚拟装置使用。该装置结构可检测并修复局部不一致预测,通过四视角循环一致性检索回环,并在全局优化前对候选重访进行几何验证,最终以 Sim(3) 位姿图修正旋转、平移与尺度漂移。在施工场地序列上,其轨迹精度与重建几何均优于前馈基线,代码已开源。
Tree-VQ 将预训练扁平 VQ 分词器事后转换为支持任意前缀的渐进式表示,保留原有编码器分配和全部学习到的叶向量。该方法把码本组织为平衡二叉层级,按深度优先顺序传输分支决策,使每个额外分支比特精确细化一个 token,传输可在几乎任意载荷位置截断。
研究者提出局部认知不确定性引导主动采样框架 LEADer,用于扩散模型图像修复(DMIR)。该方法在空间域用逐像素不确定性动态调节零空间先验强度,在时间域用不确定性轨迹量化采样稳定性以实现自适应轨迹剪枝,理论证明其满足严格数据一致性且剪枝策略具有确定性误差界。LEADer 可即插即用地集成到多种 DMIR 基线,在提升多个 SOTA 方法性能的同时显著减少采样时间,内存开销可忽略,代码已开源。
研究者提出 Latent-Action-Guided 方法,将帧间变化压缩为 latent actions 并在端到端视频-语言对齐中预测下一帧特征,无需额外空间或运动标注即可提升交互定位与时间方向敏感性。使用无大规模视频预训练的图像编码器时,该方法识别性能与 V-JEPA2/2.1 相当,推理更快且 INT4 精度下降更小。