跳到正文
今天10月7日周三1228 条
  1. 掘金77

    DeepSeek 据报接近完成至少 800 亿元融资,腾讯与宁德时代领投

    据 Bloomberg 援引知情人士报道,DeepSeek 接近完成至少 800 亿元(约 120 亿美元)融资,高于原定约 500 亿元的目标,由腾讯与宁德时代领投,最终金额可能逼近 1000 亿元。资金将用于扩大算力基础设施、加速模型研发与团队建设,公司计划 2027 年初启动科创板 IPO,中信证券已担任上市辅导机构。DeepSeek 方面未公开确认,融资细节仍可能在最后谈判中调整。

    同一新闻,精选展示《宁德时代与腾讯领投 DeepSeek 融资,公司计划 2027 年 IPO》

  2. 掘金20

    即时通讯系统的关键设计:消息同步、定序与投递可靠性

    即时通讯的核心是让不可靠、可离线的多端与服务端就"发生了哪些事、以什么顺序"达成一致,集合与序需分别保证。消息经幂等键去重、分配 seq 定序后落库投递,ACK 仅表示已受理,服务端回显才确认发送成功。同步侧通过会话链与收件箱游标实现跨会话增量拉取,写扩散适合单聊小群,读扩散适合超大群与聊天室。

  3. 掘金65

    如何搭建一个 Agent 系统:方法论、理想形态与一次真实落地

    作者以蔓藤AI 数字人创作平台的通用 AI 助手为例,讲搭建 Agent 系统的方法论与理想形态。该系统把循环放在服务端,一次用户发言最多 4 轮、每轮落一条记录,用冻结按上限、结算释放整笔加实扣的计费模型,并通过 SSE 六事件契约向浏览器推送过程。文中还列出十二个真实踩过的坑,包括提示词与工具表分家、中断导致悬空 tool_calls、空流被当成功、回调不校验归属等。

  4. Simon Willison22

    Jake Boggan 谈 Barnette 猜想被 AI 证明:24 年心血后的复杂情绪

    Jake Boggan 在 Hacker News 评论 openai/math 相关讨论时表示,自己曾为 Barnette 猜想投入 24 年、数千小时,去年夏天还一度以为已解决,如今该问题(problem 180)据称已被证明。他说听到这一消息有种遥远的悲伤,像得知前女友突然车祸去世,并猜测今晚很多人会有类似的复杂情绪。

  5. arXiv cs.CV22

    SymNetPro:基于稀疏无线电观测的 LOS 感知定向多发射机定位

    SymNetPro 在 SymNet 的双任务无线电地图重建与定位骨干上新增两个组件:稀疏 LOS 感知注意力偏置和发射机丢弃增强,用于从稀疏接收功率观测中定位多个定向发射机。在定向射线追踪城市环境实验中,其 OSPA 在极端稀疏采样下显著低于代表性定位基线,并在测量噪声和发射机数量增加时保持稳定增益。代码、数据集和模型检查点已公开。

  6. arXiv cs.CV22

    HRDexDB:跨人类与多种机器人本体的 4D 灵巧抓取数据集

    HRDexDB 是一个真实世界 4D 灵巧抓取数据集,覆盖五种本体、100 个物体、3.2K 次试验,记录 3D 手-物交互轨迹随时间的变化。它通过同步多相机系统和重建流程提供多视角与第一视角 RGB 观测、3D 手部几何、机器人状态、物体 6D 位姿轨迹及成功/失败标注。该数据集已用于人到机器人接触图迁移、视觉机器人-物体接触估计和检索辅助抓取。

  7. arXiv cs.CV27

    ChronoWorld:用时空线索与几何反射实现相机可控的一致 4D 世界生成

    ChronoWorld 提出"观测—状态—反射"框架,利用时空因果线索与重建先验生成全局一致的自由视角 4D 场景。其 Spatiotemporal Epipolar Causal Attention 机制在生成全程施加多视角对极约束与时间因果性,并配合重建驱动的几何反射管线与 4D 检索策略实现动态自评估与修正。实验显示该方法在时空一致的电影级 4D 场景生成上达到 SOTA。

  8. arXiv cs.CV24

    MT-cGAN:无需高分辨率形态学图像即可自动分割全膝关节软骨与半月板并可靠量化 T1ρ 和 T2

    研究提出多任务条件生成对抗网络 MT-cGAN,可直接从 qMRI 回波图像合成类 DESS 图像并分割膝关节软骨与半月板。在 361 名受试者共 508 例膝关节 MRI 数据上,其平均 Dice 达 0.84,优于结合迁移学习的 SOTA 条件 GAN(0.82,p<0.001),T1ρ 与 T2 量化变异系数最低,分别为 1.84% 和 1.81%。

  9. arXiv cs.CV20

    LoDEOT:用低维高效偏移 token 从倾斜影像提取建筑轮廓

    LoDEOT 用五维偏移 token 替代高维实例 token 来预测屋顶到轮廓偏移(RFO),在保留高维实例 token 做检测与分割的同时,将实例 token、浓度门控屋顶和框掩码证据映射为五维偏移 token,再经独立二维读出。在 BONAI 数据集上,其 FAP50 达 54.58、mEPE 为 5.23 像素,FAP50 比所评估的端到端基线高出 7.56-16.85 个百分点。

  10. arXiv cs.CV22

    SteadySplats:低方差高斯重采样实现高保真随机渲染

    SteadySplats 通过基于历史的空间重采样与时间重要性重采样,在随机渲染中大幅加速图像收敛并保证相机运动下的连贯性;训练阶段的颜色正则项则隐式降低 3DGS 模型沿视线方向的方差。其基于 Vulkan 的渲染器在每像素 1 采样下较此前随机方法提升约 13 dB PSNR,并快速收敛至排序 3DGS,平均 L1 误差低于 10^-4。

  11. arXiv cs.CV22

    VolS-GS:基于体素次表面散射的可重光照 Gaussian Splatting 框架

    VolS-GS 是一个可重光照的 Gaussian Splatting 框架,通过将高斯场景的空间支撑作为可微有限体积传输求解器的域,让光线在物体内部传播,从而建模次表面散射等非局部效应。该框架用小型网络为每个 Gaussian 预测散射与吸收系数,并在三个 OLAT 基准上持续提升新光照与新视角下的重光照质量。

  12. arXiv cs.CV22

    DiDE:面向 3D 风格化的颜色-纹理解耦直接注入框架

    DiDE 是首个面向解耦式 3D 风格化(Disen3D)的免训练框架,可将颜色与纹理独立迁移到生成的 3D 资产上。它利用图像到 3D 模型潜空间中纹理仅占少量风格通道的特性,通过通道划分机制分别处理内容图、纹理参考和颜色参考,并在每个自注意力层无干扰地组合两种风格信号。

  13. arXiv cs.CV22

    4D 场景重建综述:以场景表示为中心的动态世界重建统一视角

    一篇综述从场景表示、时序建模、重建流程与优化目标四个维度统一梳理 4D 场景重建方法,涵盖 NeRF 与 3D Gaussian Splatting 等路线。该框架分析了不同设计选择对几何保真度、外观一致性、运动表示与计算效率的影响,并整理了常用数据集与评测指标,指出当前实验实践的局限与开放挑战。相关论文与资源集合持续更新。

  14. arXiv cs.CV24

    TripleFlow:无需训练的视频对象移除,桥接残差编辑与原生生成

    TripleFlow 是一个无需训练的视频对象移除框架,通过协调源流、残差流与合成流,将擦除与生成紧密耦合。它复用单次目标预测,由残差流抑制对象、合成流独立重建被遮挡背景,并在每一步将合成背景注入编辑轨迹。在五个基准上,TripleFlow 在重建保真度与时间一致性上均显著优于现有基线,达到新的 SOTA。

  15. arXiv cs.CV22

    MeshOctave:用顶点拆分重连级联实现原生网格生成

    研究者提出 MeshOctave,通过二进空间网格分辨率定义尺度,将网格粗化视为体素单元内顶点合并的确定性坍缩,并用 split-and-rewire 逆操作逐面确定八分体子顶点与局部连接,无需序列化即可并行生成。该方法采用尺度条件掩码均匀离散扩散模型学习该操作,在几何保真度与拓扑有效性上大幅超越强基线,并支持自适应分辨率细化与网格细分任务。

  16. arXiv cs.CV22

    基于轨迹对齐字形渲染的视频文本编辑方法,在 VTEdit 基准上实现 0.9408 句子准确率

    研究者提出轨迹对齐字形渲染参考与深度归一化识别器特征监督,解决视频扩散模型难以复现精确笔画结构、易生成乱码字符的问题。同时构建 VTEdit 基准,包含 288 个真实场景片段和 440 条标注文本轨迹,覆盖文本替换与添加任务。实验显示该方法在文本准确率和背景保持上优于图像文本编辑方法、视频编辑方法及商业模型,句子准确率达 0.9408,并在用户研究中获得最高偏好。

  17. arXiv cs.CV24

    HARMONY:面向单目图像到场景合成的分层智能体推理框架

    HARMONY 是一个分层链式思维框架,结合智能体推理与视觉几何基础模型,从单张室内场景图像重建完整 3D 场景。它先校准相机建立语义空间框架,再按墙面元素、独立家具、家具上装饰物的分层顺序放置物体,并用深度优先遍历和反思反馈循环避免误差累积。实验表明 HARMONY 在合成与真实图像上优于所评估的重建基线,与 GPT-6 Astra 的定性对比显示其物体布局更忠实、场景细节保留更好。

  18. arXiv cs.CV22

    从潜在分布视角评估与改进潜在生成模型

    针对重建 FID(rFID)与生成 FID(gFID)相关性弱甚至为负的问题,研究者提出生成感知重建(GAR),通过向编码器 latent 加噪并经生成模型去噪,构建从重建到生成的连续轨迹。基于该轨迹的诊断指标 GAR-FID 在多种 tokenizer 和规模下与 gFID 强相关,且中间 GAR latent 保留与源图像的配对监督,可用于解码器适配,在不同模型规模上持续提升生成质量。

  19. arXiv cs.CV22

    RIGOR:面向全景视频重建的虚拟四目装置几何方法

    RIGOR 是一个面向重力对齐全景视频的大规模三维重建管线,保留冻结的前馈透视骨干网络,将每张全景图当作四视角虚拟装置使用。该装置结构可检测并修复局部不一致预测,通过四视角循环一致性检索回环,并在全局优化前对候选重访进行几何验证,最终以 Sim(3) 位姿图修正旋转、平移与尺度漂移。在施工场地序列上,其轨迹精度与重建几何均优于前馈基线,代码已开源。

  20. arXiv cs.CV17

    LEADer:局部认知不确定性引导的即插即用扩散图像修复主动采样框架

    研究者提出局部认知不确定性引导主动采样框架 LEADer,用于扩散模型图像修复(DMIR)。该方法在空间域用逐像素不确定性动态调节零空间先验强度,在时间域用不确定性轨迹量化采样稳定性以实现自适应轨迹剪枝,理论证明其满足严格数据一致性且剪枝策略具有确定性误差界。LEADer 可即插即用地集成到多种 DMIR 基线,在提升多个 SOTA 方法性能的同时显著减少采样时间,内存开销可忽略,代码已开源。

  21. arXiv cs.CV22

    Latent-Action-Guided 视频-语言特征学习用于手术器械-组织交互识别

    研究者提出 Latent-Action-Guided 方法,将帧间变化压缩为 latent actions 并在端到端视频-语言对齐中预测下一帧特征,无需额外空间或运动标注即可提升交互定位与时间方向敏感性。使用无大规模视频预训练的图像编码器时,该方法识别性能与 V-JEPA2/2.1 相当,推理更快且 INT4 精度下降更小。