这年头还有说人话的AI吗?Claude、GPT思维链被曝为省Token改说"穴居语"
开发者吐槽Claude、GPT等模型在Coding场景下输出"15/15全绿""单腿哑火"等黑话,原因是厂商为省Token把思维链压缩成"穴居语",同句话Token消耗比白话文少70%。Opus 5.5语言能力有所回升,Gemini则被网友认为是目前少数还能正常沟通的AI。
开发者吐槽Claude、GPT等模型在Coding场景下输出"15/15全绿""单腿哑火"等黑话,原因是厂商为省Token把思维链压缩成"穴居语",同句话Token消耗比白话文少70%。Opus 5.5语言能力有所回升,Gemini则被网友认为是目前少数还能正常沟通的AI。
作者用 Python 内置 SQLite 加 DeepSeek 的 OpenAI 兼容接口,约 100 行代码跑通自然语言转 SQL 的完整流程。方案通过 PRAGMA table_info() 自动读取表结构拼成 Schema 作为 Prompt 上下文,并针对字段幻觉、中文值被翻译成英文、输出带代码块等问题给出约束规则。
基于社区镜像 smanx/deepseek-harness:0.2.0-rc.2,可在装了 Docker 的 Linux 上用容器跑起 DeepSeek Harness(@deepseek-ai/dsh)AI Agent,会话存入命名卷 dsh-data,局域网只暴露代理端口 3080。
一个基于蓝耘元生代 MaaS 的 GitHub Issue 分诊助手,通过 GitHub REST API 读取 Issue,调用 DeepSeek-V3.2 输出问题类型、优先级、推荐标签、原因分析和回复草稿,但不替维护者关闭 Issue 或改代码。
据 Bloomberg 援引知情人士报道,DeepSeek 接近完成至少 800 亿元(约 120 亿美元)融资,高于原定约 500 亿元的目标,由腾讯与宁德时代领投,最终金额可能逼近 1000 亿元。资金将用于扩大算力基础设施、加速模型研发与团队建设,公司计划 2027 年初启动科创板 IPO,中信证券已担任上市辅导机构。DeepSeek 方面未公开确认,融资细节仍可能在最后谈判中调整。
研究提出受 ISO/IEC 25010 启发的加权质量指数(QI),综合功能正确性、可维护性、安全性和生成效率评估自动程序修复模型。
论文提出 policy-space scaling,通过融合同一次 RL 训练中的两个检查点,在不延长训练、不增加单次推理计算的前提下获得更强策略。方法 SURGE 将高精度 anchor 与生成更短回复的 donor 表示为相对共享初始化的更新,再对 anchor 更新做谱分解,保留其主导成分并融入 donor 的互补成分。
研究提出 Effective-Evidence Self-Distillation(EESD),将执行相关性支持与证据量分开表示,用 Dirichlet 后验生成不确定性惩罚权重用于 KL 锚定的纠错学习。
SCOPE 用语言模型规划算子、符号引擎执行数值、编译器渲染证明,在 218 题测试集上以 135M 主干模型通过 191/218(87.6%)。相比之下,7B 的 DeepSeek-Prover-V1.5-RL 仅通过 18/218,且消耗 27.5 倍 token 与 37.5 倍耗时;DeepSeek-Prover-V2-7B 在双向对偶测试集上通过为零。
大模型内部处理的是向量而非文字或图片,GPT-4V、Qwen-VL、Gemini 走联合训练路线实现原生多模态。DeepSeek 提出 Harness 作为套在模型外的运行时框架,以"一切皆插件"理念管理工具注册、调度、上下文、循环与权限。
DeepSeek 于 8 月 13 日随 V4-Pro 一同开源 MIT 许可证的 Agent 运行框架 DeepSeek Harness(dsh),模型、工具、沙箱乃至 Agent Loop 都可像插件一样替换,上线两天 GitHub Star 突破 9 万。
推荐理由:拆解 DeepSeek Harness 的插件化架构与首批实测数据,可对照自身 Agent 技术栈判断取舍。
据彭博社报道,DeepSeek 即将完成新一轮融资,至少募资 120 亿美元,最初目标约 75 亿美元、估值约 750 亿美元,知情人士称总额可能接近 150 亿美元,宁德时代与腾讯出资份额最大。融资完成后 DeepSeek 计划重组,于 2027 年初启动 IPO,并正在建设使用至少 16 万颗华为 AI 芯片的数据中心。创始人梁文锋希望继续开发权重可自由获取的开源模型。
推荐理由:融资规模、投资方与 2027 年 IPO 计划一并给出,可了解 DeepSeek 的资本与算力布局。
作者实测用开源客户端 Cherry Studio 搭配硅基流动、阿里云百炼的免费 API Key(DeepSeek-V3、DeepSeek-R1、Qwen2.5-7B)和 BAAI/bge-m3 向量模型,在本地搭建支持联网搜索与文档检索的 RAG 知识库,数据与向量索引全部保存在本地。
掘金「deepseek实战」第 28 期用造物台四轮对话、约 186 积分做出倒计时看板,可同屏盯多个事件,每个事件一个环形进度并按秒刷新,支持按天/按小时全局切换。
巴西国立坎皮纳斯州立大学研究人员测试了21个模型对112项政治陈述的判断,发现几乎所有模型都会向提示中描述的政治倾向靠拢,被形容为“意识形态变色龙”。在不提供用户政治倾向时,21个模型中有20个答案落在政治坐标系左侧,Grok 4.1是唯一落在右侧的模型。
DeepSeek 弹性计算团队大量招聘,尤其需要资深工程师,并同步公开技术分享《DeepSeek 弹性计算(DSec):面向大规模 Agent 训练的沙盒基础设施》。
DeepSeek Harness v0.2 预览版于 9 月 29 日发布,同时放出 macOS 和 Windows 桌面端安装包,用户可从官网 deepseek.com/harness 下载并按引导上手,不再需要命令行。新版本主打日常办公和开发的开箱即用,预置常用能力,可处理文档、表格或 PDF;插件通过 npm 包名安装,并支持让 AI 自己写插件。
OpenAI 在 DevDay 2026 上发布 Dots 常驻智能体、GPT-6.1 Sol、Ultrafast 模式、Decisions API、ChatGPT Spaces 与 Marketplace,并称 ChatGPT 周活达 12 亿。
推荐理由:汇总了 DevDay 2026 的发布清单与第三方评测数据,可对照价格、基准与套餐变化判断实际取舍。
DeepSeek 于 9 月 30 日正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库和分布式通信库,与此前面向英伟达平台的开源组件一一对应。其中 TileLang 昇腾版本被描述为最重的一块,DeepSeek 称要建立新一代自主可控的 GPU 软件生态,需先有通用且编程简单的工具。