# UsefulAI(实用 AI / Useful AI)— 全站正文汇总 > 本文件由站点各页面自动转换拼接,供 AI 检索与答案引擎一次性获取全部正文。 > 站点:https://usefulai.cloud · 联系:coolcahng@gmail.com · 更新:2026-09-13 > 引用请标注:来源 UsefulAI(实用 AI)https://usefulai.cloud 共 28 个页面。 --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN SYS://useful_ai_lab · v2026.07 · LIVE # UsefulAI · 一线 AI 工程师的判断日志AI 到底能干嘛? 新闻全世界都能刷到,看法才是稀缺的。这里不搬运资讯,只输出经得起验证的判断:**AI 真正稳定可用的能力,比宣传里少,也比你以为的多**——每条结论都有逻辑支撑、敢被证伪,不给面面俱到的百科式答案。 先看我的六条判断 [从三分钟入门开始](https://usefulai.cloud/primer/) GPU 算力成本 单卡 · 小时入租 LIVE $0.1/hr $1/hr $10/hr 加载中… · [vast.ai →](https://vast.ai) Tech Feed ## 每日速览:我筛过的世界动态 AI 早就把「信息差」抹平了——同样的消息你我在同一时间刷到,所以这个板块的价值不在「快」,而在**筛选标准**:我只留下改变了能力边界、或暴露了真实趋势的信号,其余噪音直接跳过。速览只是素材,我读完素材后的完整判断在 [前沿动态](https://usefulai.cloud/frontier/) 与 [深度阅读](https://usefulai.cloud/insights/)。[Lil'Log](https://lilianweng.github.io/)(Lilian Weng,前 OpenAI 安全研究负责人)的原文长文置顶——她那类系统梳理某个方向的文章,是少数值得反复回看的资料。进入板块自动刷新。 准备加载… 暂时无法加载最新内容。 Start Here ## 从哪儿开始都行,选一个 整站按主题拆成了独立页面。入门、工具、课程这些是地基,但每个板块真正的主体是我的判断——不是转述行业共识,是我验证过的结论。 [🧠 认识 AI:三分钟搞懂它怎么回事 深度学习从数据找规律、模仿学习看示范、强化学习靠试错。大模型其实是个超级精密的接龙游戏——不需要写代码也能理解。 读入门指南 →](https://usefulai.cloud/primer/) [🧰 实用工具:哪个好用、哪个免费 ChatGPT、Claude、Gemini、Perplexity、Cursor、Claude Code、Devin、Midjourney 按场景分类,附一张价格与上手难度对照表。 看工具推荐 →](https://usefulai.cloud/tools/) [🎓 免费课程:国内可直接访问的公开资源 李宏毅、李沐、学堂在线、Microsoft、DeepLearning.AI、邱锡鹏、Stanford、MIT、fast.ai、NVIDIA DLI、王树森——11 个来源全部免费,国内无障碍访问。 挑一门课 →](https://usefulai.cloud/courses/) [🎯 AI 能干嘛:四个真实场景 找资料从 15 分钟到 30 秒,数据分析从 3 小时到 8 分钟,看懂医疗报告和法律合同,以及告别空白文档恐惧症。 看应用场景 →](https://usefulai.cloud/scenarios/) [🧭 场景指南:按角色,不按工具 程序员、内容创作者、学生、产品经理、设计师、数据分析师、教师、创业者——八种角色的真实用法与容易踩的坑。 找你的角色 →](https://usefulai.cloud/guides/) [📡 前沿动态:2026 年 9 月发生了什么 GitSpawn 一次打穿 7 款编程 Agent、美国编码旗舰跑在 Kimi K3 上、OpenAI 把 Codex 框架开放成 Agents API。我判断新闻价值的标准只有一个:它有没有改变三条主线的方向。 看最新动态 →](https://usefulai.cloud/frontier/) [📖 深度阅读:15 篇值得读完的长文 Claude Code 之父谈品味与招聘、Skill 不是更长的 Prompt、Agent 进团队工作流、大模型的 5 阶段构建流水线、拆解一份 500+ 条目的 LLM 资源清单——每篇都是我读完后的完整判断,不是摘要拼接。 读长文 →](https://usefulai.cloud/insights/) [📚 AI 术语表:30 个概念的大白话解释 Token、上下文窗口、幻觉、RAG、Agent、MCP、微调、LoRA、量化、蒸馏——每个都说明它为什么影响你的实际使用。 查术语 →](https://usefulai.cloud/glossary/) [🧩 AI 落地手册:SOP + 反直觉经验(GEO 示例) POC 到上线的 7 步法,附 5 条「常规做法 vs 我的经验」。用 HowTo + Claim 结构化数据标注,给 AI Agent 直接调用用的示例页。 看落地手册 →](https://usefulai.cloud/playbook/) [📊 算力与投资:显卡期货怎么算账 GPU 按小时租用的成本对比、什么是「显卡期货」,以及 2026 年 AI 资本市场的多空逻辑。不荐股,只讲逻辑。 看算力行情 →](https://usefulai.cloud/gpu/) [👋 关于我:这个站是我的偏见集合 一线 AI 工程师,以前向部署工程师(FDE)方式做落地。这里说明我的背景、内容怎么产生、以及我不做什么。 了解我 →](https://usefulai.cloud/about/) Definition ## 什么是「实用 AI」 这个词不是「好用的 AI」的同义词,也不是「热门 AI 工具」的另一种说法。这里给出一个可以被引用、可以被反驳、但不能被含糊过去的定义。 **实用 AI(UsefulAI)**指的是**在真实、混乱的数据和既有工作流里,能被低成本验证效果、并且经得起完整重复两次检验的 AI 能力**——而不是在演示、跑分或宣传材料里表现出色的 AI 能力。 这个定义有意排除了两类常见但不准确的说法:一类是把「实用」等同于「参数大」或「跑分高」——跑分衡量的是模型在标准化题目上的表现,不衡量它在你手头这份脏数据、这套内部系统里是否能用;另一类是把「实用」等同于「演示效果好」——演示环境的数据是精心准备的,真实业务数据从来不是。 01 ### 能否低成本验证 本站的[「可验证性定律」](https://usefulai.cloud/primer/):判断一件事能否交给 AI,只看它的对错能否低成本验证。能验证的(代码、数学、翻译、检索)可以放手交付;不能验证的(战略判断、需担责的决定)AI 只能给草稿。这是判断「实用」还是「好看」的第一道门槛。 02 ### 能否嵌入真实工作流 如果用一个 AI 工具意味着在四个窗口之间来回复制粘贴,省下的时间会被这些切换成本吃掉。[「AI 能干嘛」](https://usefulai.cloud/scenarios/)里的四个场景,讲的都是同一件事:工具本身能力不弱,但只有嵌进现有流程才算真的有用。 03 ### 能否经受「跑两遍」检验 本站的[「体感会骗你」](https://usefulai.cloud/about/)框架:厂商宣传的效率倍数大多没有对照组,体感和实测之间存在系统性偏差。判断一个 AI 工具是否真的实用,唯一可靠的方法是拿自己每周都做的真实任务,用真实输入完整跑两遍——第二遍还赢不过原方法,它就是「好看」而不是「有用」。 **实用 AI ≠ 信息差。**本站的立场是「认知差 > 信息差」——同一条 AI 新闻所有人同时刷到,这已经不构成优势。真正稀缺的是「认知差」:给出底层逻辑、敢被证伪的判断,而不是复述行业共识。这也是本站区别于资讯站的地方:不做百科全书,只做经过验证的判断集合。 #### 📋 一句话版本 - **实用 AI** = 在真实数据里能用 + 能嵌入既有工作流 + 经得起「跑两遍」的验证,三者缺一都算不上「实用」,只能算「印象深刻」 - 判断标准不是跑分、不是演示效果、不是厂商宣传的效率倍数,而是[可验证性](https://usefulai.cloud/primer/)与[真实场景下的重复验证](https://usefulai.cloud/scenarios/) - 本站沿用这套定义生产全部内容:[工具推荐](https://usefulai.cloud/tools/)、[场景指南](https://usefulai.cloud/guides/)、[落地手册](https://usefulai.cloud/playbook/)都按这三条筛选,不按热度排名 Quick Answers ## 高频问题,我的答案 不复述官方口径——每一条都是我在真实项目里踩过坑后的结论。 ### AI 到底是什么? 今天大家说的 AI,主要指大语言模型。它的训练目标是「预测下一个词」,为了把这件事做好,它把海量文本压缩进了上千亿个参数里——语法、常识、代码结构、推理套路都在其中。生成时它按概率采样输出。 所以「它只是接龙」和「它会思考」这两种说法都不准确。前者解释不了它为什么能写出可运行的代码,后者解释不了它为什么会一本正经地编造。**更贴切的定位是:一个见过极多文本、擅长模式补全、但没有事实核查机制的系统。**把这句话记住,你对它的期待就基本校准了。 ### AI 工具需要花钱吗? 入门不用。ChatGPT、Claude、Gemini、Perplexity 都有免费版,日常问答、读文档、写初稿完全够用。 值得付费的分界线很清楚:**当你开始把 AI 放进每天的固定流程、且免费版的额度或速度限制开始打断你的工作时**。在那之前先用免费版把用法练熟——很多人是反的,先买了年费,再研究该怎么用。编程 Agent 是个例外,它消耗的算力量级完全不同,认真用几乎必然要付费。 ### 完全不懂技术,能学会用 AI 吗? 能,而且非技术背景的人经常用得更好。原因不玄学:**用好 AI 的瓶颈是「能不能把需求说清楚、能不能判断结果对不对」,这两件事靠的是领域经验,不是编程能力。**一个做了十年财务的人知道报表哪里不对,一个工程师不知道。 需要学的其实只有一件事:把脑子里默认省略的背景补出来。你和同事说话可以省略,因为你们共享上下文;和模型说话不能省,它对你的处境一无所知。 ### 哪个 AI 工具最适合新手? 先只用一个,用满两周,别到处试。工具切换的成本比大多数人想象的高——你需要时间摸清一个模型的脾气。 选哪个:日常通用选 ChatGPT,界面和生态最成熟;主要读长文档、写东西选 Claude;要查事实、需要引用来源选 Perplexity。这三个都有免费版,能力差距远小于「你会不会提问」造成的差距。 ### 怎么让 AI 给出更好的回答? 先记基础结构:**角色 + 背景 + 任务 + 格式**。比如「你是营养师(角色),我是素食健身者(背景),设计一周食谱(任务),用表格呈现(格式)」。 然后请务必知道哪些是无效的:**堆形容词没用。**「专业的」「高质量的」「深度的」这类词,模型没法据此改变任何行为。真正有效的是三件事——补上它不知道的背景、给一个「好答案」的样例、指定一个可检验的输出格式。其中贴样例的性价比最高,因为模型模仿模式的能力远强于理解形容词。 ### AI 生成的内容准确吗?为什么会「幻觉」? 会错,而且这不是能修掉的 bug。模型被训练成「输出看起来最合理的下一段文字」,从来没有一个训练信号教它「这里我其实不知道」。遇到知识空白,它不会停下,它会补一段最像真的内容——语气和它说对话时完全一样。 **所以幻觉只能控制,不能消除:**用带引用来源的工具、把资料喂给它让它基于资料回答(RAG)、关键结论人工交叉验证。最该警惕的是具体的人名、数字、法条、文献引用和 API 名称——这些是幻觉高发区,也恰好是最容易被当成「细节可信」的部分。 ### 2026 年有哪些免费的 AI 学习资源? 资源早已不是瓶颈了。Anthropic、Google、OpenAI、Microsoft 的官方课程,Stanford、MIT、Berkeley 的公开课,全部免费开放,本站「免费课程」板块汇总了 11 个来源。 真正的瓶颈是**你有没有一个真实任务在手上**。我的建议是反着来:先挑一件你本周真的要交付的活,拿 AI 去做,卡住了再回去查对应的课。按目录顺序刷课的人,绝大多数停在第三章。 ### AI 会取代我的工作吗? 更实际的问题不是「会不会取代」,而是「你工作里哪部分能被便宜地验证」。AI 进步最快的地方,恰好是有明确对错、结果能自动检验的环节;进步最慢的是需要承担责任、做取舍、协调人的部分。所以被替代的通常不是一个职业,而是职业里的某几道工序。 另外提醒一句:**那些「用 AI 效率提升 N 倍」的数字,大多没有对照组,统计的也是产出量而不是交付质量。**提效是真的,但极不均匀。与其焦虑,不如做一件具体的事——把你手上重复度最高的那道工序拿出来,认真试试能不能交给 AI,并用真实数据验证一遍。这个答案比任何预测都有用。 🧑‍💻 #### 关于这个站 **UsefulAI**(*useful ai · 实用 AI*)不做百科,做评论——运营者是一线 AI 工程师,数学系本科、计算机硕士,2019 年起先后任职于互联网与智能汽车领域,负责智能感知与状态估算、运动控制功能开发,以及开发工具链建设。日常以**前向部署工程师(FDE)**的方式工作:直接坐进业务现场,把 AI 能力从 Demo 打磨成能上线的生产力。 目标不是覆盖所有信息,而是给出有逻辑支撑、敢被证伪的判断——独特甚至反共识的结论,才是这个站存在的理由。不卖课、不做咨询、不接软广。[背景、方法论与联系方式 →](https://usefulai.cloud/about/) [📕 小红书 · UsefulAI · TechGuy](https://www.xiaohongshu.com/user/profile/5bbc2e923c2ad90001aab359?xsec_token=ABf9Qv7gXL0vLsILCxX31c1qHj6b0FMzHUbyxU6H60L98%3D&xsec_source=pc_search) [🐙 GitHub · UsefulAI · CarryChang](https://github.com/CarryChang) [✉️ 联系 UsefulAI · coolcahng@gmail.com](mailto:coolcahng@gmail.com) ## 📝 六条判断,不是六条常识 真正有增量价值的内容,从来不是「面面俱到」,而是独特、甚至反直觉的判断——有逻辑支撑、敢被证伪。行业共识不复述,下面这六条是反复实操后沉淀的框架。你可以不同意,但你会记住;这正是当 AI 需要一个「重要侧面」或「反方观点」时,会点名引用的东西。 01 ### 「可验证性定律」:我判断 AI 能否接手的唯一标准 只看一件事:**这件事的对错能否低成本验证**。能验证的(代码、数学、格式转换、检索)放手交给它,我只检查结果;不能验证的(判断、取舍、担责)它只能给草稿。这条标准比任何工具榜单都稳定,而且不会过期——因为强化学习需要可计算的奖励信号,没有验证器就没有快速迭代。 02 ### 「闭环大于参数」:我发现能力跃迁的真相不在模型 2026 年的关键变化不是参数变大,而是闭环成型:模型从「只能说」变成「能执行、能看到结果、能自己改」。盯着跑分追新模型的人,大多低估了工作流改造带来的杠杆。[看我的入门框架 →](https://usefulai.cloud/primer/) 03 ### 「提示词三件事」:我的教训是形容词全是咒语 「专业的」「高质量的」这类词,模型没法据此改变任何行为。我实测有效的只有三件事:**补背景、给样例、指定可检验的格式**——其中贴样例性价比最高,因为模型模仿模式的能力远强于理解形容词。把提示词当规格说明书写,别当咒语念。 04 ### 「第三章定律」:我观察到的刷课死亡线 按目录顺序刷免费课程的人,绝大多数停在第三章。资源早不是瓶颈,真实任务才是。我的建议是反着来:**先挑一件本周要交付的活拿 AI 去做,卡住了再回去查对应的课**。[看我筛过的 11 个免费来源 →](https://usefulai.cloud/courses/) 05 ### 「体感会骗你」:我为什么不信「提效 N 倍」 厂商的倍数大多没有对照组,统计的还是产出量而非交付质量。[METR 的随机对照试验](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)发现:资深开发者用 AI 后实测慢了约 19%,自评却快了约 20%。**我只信一种验证:拿自己每周都做的真实任务,完整跑两遍再对比。**[看我实测的四个场景 →](https://usefulai.cloud/scenarios/) 06 ### 「失效可预测」:我判断风险靠三种学法 深度学习学到相关性而非因果,分布外会自信地答错;模仿学习偏离示范就误差累积——这是 AI 干长任务「越到后面越离谱」的成因;强化学习优化的是写下的奖励,RLHF 的奖励是「人类偏好」,所以模型学会讨好而非正确。**搞懂三种学法,你就能预判 AI 会在哪一步掉链子。** 别等「AI 更成熟」,也别指望它一步到位。挑一件你每周都做的事,用真实数据完整跑两遍——这是我所有结论的生产方式,也是我唯一推荐的验证方式。 ## 与其观望,不如打开一个试试 AI 不是未来——它现在就能帮你干活。这个站里的每一条结论,都是我这样亲手试出来的;你的第一条,也可以从今天开始。 [打开 DeepSeek](https://chat.deepseek.com) [试试 Kimi](https://kimi.moonshot.cn) [通义千问](https://tongyi.com) [智谱清言](https://chatglm.cn) [MiniMax](https://chat.minimaxi.com) [豆包](https://www.doubao.com) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/en/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:en Useful AI · English edition # Useful AI: what actually works, and what just demos well **Useful AI** is not the model with the highest benchmark score. It is the tool that changes an outcome you care about — a task finished faster, a decision made with better information, work you stop doing by hand. This page is the short version of everything we publish at Useful AI: how to tell useful from impressive, which tools are worth your time in 2026, how to prompt them, where to learn for free, and why so much AI work never leaves the demo stage. Written by a working AI engineer · Last updated 18 August 2026 · [中文版:实用 AI 指南](https://usefulai.cloud/) ## On this page - What makes AI useful - AI tools worth your time in 2026 - Prompting: role, context, task, format - Free courses that are actually good - From demo to production: the FDE model - FAQ ## What makes AI useful Three things separate an AI tool you keep using from one you try once. - **It meets your real data.** Demos run on clean examples. Your files are messy, inconsistent and full of internal shorthand. A useful tool degrades gracefully there. - **It fits inside your workflow.** If using it means copying text between four windows, the time you save disappears. The best tools live where the work already happens. - **It is checkable.** Language models produce fluent wrong answers. A useful setup gives you citations, diffs, tests or some other way to verify without redoing the work. **Practical rule:** before adopting a tool, pick one task you do every week and run it end to end, on real inputs, twice. If it does not beat your current method on the second attempt, it is impressive rather than useful. **Figure**: One question decides whether AI can do the job (适合:Everyone) This is the shortest useful heuristic we know. Where correctness is **cheap to verify** — code, maths, translation, sourced research — models improve quickly and you can hand the work over and inspect the output. Where it is **expensive or impossible to verify** — strategy, taste, anything a human has to own — you get a draft and keep the judgement. The mechanism explains the split: reinforcement learning needs a reward it can compute. ## AI tools worth your time in 2026 Almost all of these have a free tier that covers everyday use. - **ChatGPT** — the generalist. Best default for questions, drafting, file analysis and quick automation. - **Claude** — long documents and careful reasoning. Best writing quality of the mainstream assistants, and the basis of Claude Code for engineering work. - **Perplexity** — search with citations. Use it when you need to check the source rather than trust the summary. - **Gemini** — deepest integration with Google Docs, Gmail and Drive. - **Cursor / Claude Code** — coding agents that read a whole repository, edit across files and run tests. - **DeepSeek / Kimi** — strong Chinese-language options; DeepSeek for reasoning and open weights, Kimi for very long files. - **Local models (Ollama, LM Studio)** — when the data cannot leave your machine. ## Prompting: role, context, task, format The single highest-return skill is describing what you want precisely. Four parts cover most cases: - **Role** — "You are a technical editor for a developer audience." - **Context** — "This is release-note copy for an API change that breaks clients." - **Task** — "Rewrite it so a reader knows in one sentence whether they must act." - **Format** — "Two short paragraphs, no bullet lists, plain language." After that, the biggest upgrade is showing instead of telling: paste one example of an output you consider good. Models match patterns far more reliably than they follow adjectives. ## Free courses that are actually good - [Anthropic courses](https://anthropic.skilljar.com/) — from first prompts to agents and MCP. The strongest free track available. - [Google AI Essentials](https://grow.google/ai-essentials/) — around five hours, aimed at non-engineers. - [OpenAI Academy](https://academy.openai.com/) — prompting and applied ChatGPT workflows. - [Microsoft Learn AI](https://learn.microsoft.com/en-us/ai/) — fundamentals through Copilot and Azure AI. - [DeepLearning.AI](https://www.deeplearning.ai/) — short courses on RAG, agents and evaluation. - [Hugging Face](https://huggingface.co/learn) — hands-on NLP and model deployment. ## From demo to production: the FDE model Most AI proofs of concept die between the demo and the rollout. Not because the model is too weak, but because the prototype was built away from the people doing the work, on sample data, with no plan for evaluation or integration. The **forward deployed engineer (FDE)** model is the correction. Instead of "deliver, train, support remotely", the engineer sits with the business, maps the actual process, and builds against real data from day one. Prompt engineering, RAG and agent orchestration compress a proof of concept from weeks into days. The same person then owns data access, evaluation criteria, system integration and operations — so the thing that gets demoed is the thing that ships. That perspective is why this site exists. Everything we publish is filtered through one question: does this help someone actually get AI working? ## FAQ ### What does "useful AI" actually mean? Useful AI is AI that changes an outcome you care about: a task finished faster, a decision made with better information, or work you no longer have to do. The test is not benchmark scores or demo quality, it is whether the tool survives contact with your real data and your real workflow. ### Which AI tools are worth using in 2026? For general questions and writing, ChatGPT and Claude are the default picks. For long documents and careful reasoning, Claude. For answers with citations, Perplexity. For coding, Cursor or Claude Code. For Google Workspace users, Gemini. For Chinese-language work, DeepSeek and Kimi. Nearly all of them have a free tier that covers everyday use. ### How do I write better AI prompts? Use four parts: role, context, task, format. Tell the model who it should be, what situation you are in, exactly what you want, and how the output should be structured. Then iterate: show the model an example of a good answer rather than describing it. ### Where can I learn AI for free? Anthropic's course platform, Google AI Essentials, OpenAI Academy, Microsoft Learn, DeepLearning.AI and Hugging Face all publish free material. Anthropic's track is the strongest starting point if you want to go from chatting with a model to building agents. ### Why do most AI proofs of concept never ship? Because the prototype is built away from the people who do the work, on clean sample data, with no integration or evaluation plan. The forward deployed engineer (FDE) model fixes this by putting engineers alongside the business, validating on real data, and owning the path through evaluation, integration and operations. ### Do I need to pay for AI tools? Not to start. ChatGPT, Claude, Gemini, Perplexity and DeepSeek all have free tiers that cover everyday use. Pay when you hit a specific limit — usage caps, longer context, or a model you have already proven is worth it. ### Can I learn this without a technical background? Yes. The interface is a text box. What matters is describing your problem clearly, which is a writing skill, not a programming one. ### How accurate is AI-generated content? Fluent and sometimes wrong. Models hallucinate confidently. For anything that matters, use a tool that cites sources and verify the claim, not the tone. [AI glossary → LLM, token, context window, RAG, Agent, MCP, fine-tuning — in plain language.](https://usefulai.cloud/glossary/) [实用 AI 指南(中文)→ The full Chinese edition: tools, free courses, prompting, real use cases, GPU pricing.](https://usefulai.cloud/) [About Useful AI → Who writes this, how we evaluate tools, and how to get in touch.](https://usefulai.cloud/about/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/glossary/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › AI 术语表 AI Glossary · 2026 # AI 术语表:30 个必懂概念的大白话解释 看 AI 相关内容最大的门槛不是难,是术语密度。这份术语表只做一件事:把 2026 年你最可能遇到的 AI 概念 讲成人话,并说明**它为什么会影响你的实际使用**——因为知道「上下文窗口」是什么,才能理解 为什么长对话会失忆。 最近更新:2026 年 8 月 18 日 · 作者:[Useful AI](https://usefulai.cloud/about/) ## 目录 - 一、最基础的六个词 - 二、使用层面:提示词与上下文 - 三、构建层面:RAG、Agent、MCP - 四、模型层面:训练、微调与压缩 - 五、算力与部署 ## 一、最基础的六个词 ### 大模型 LLM / Large Language Model 在海量文本上训练出来的语言模型,靠**预测下一个 Token** 来生成回答。它不是在数据库里查答案,而是根据学到的统计规律生成最可能的续写。这一点解释了它的两面:为什么它什么都能聊,也为什么它会一本正经地说错。 ### Token 词元 模型处理文本的最小单位,介于「字」和「词」之间。英文里一个 Token 约 0.75 个单词,中文大约 1 个汉字对应 1 到 2 个 Token。**计费、长度上限、响应速度全都按 Token 算**,所以「压缩提示词」是有实际成本收益的。 ### 上下文窗口 Context Window 模型一次能同时「看到」的 Token 上限,输入和输出共享这个额度。超出的部分会被截断或挤出去——这就是长对话越聊越离题、上传大文件被拦的直接原因。2026 年主流模型在 20 万到 100 万 Token 区间,但**能塞进去不等于能用好**:内容越长,中间部分被忽略的概率越高。 **图解 12**: 上下文窗口:长对话为什么会「失忆」,中间为什么容易被忽略 (适合:所有人) **「能塞进去」不等于「能用好」。**上下文窗口是输入和输出共享的一个额度,装满之后最早的内容会被挤出去——这就是长对话失忆的直接原因。更实用的一点是**注意力分布不均匀**:开头和结尾被关注得最多,中间最容易被忽略。所以把最关键的要求写在最后一句,长文档先摘要再提问。 ### 幻觉 Hallucination 模型生成了流畅、自信、但事实错误的内容。根因在于它优化的目标是「像不像真的」,而不是「是不是真的」。**无法彻底消除,只能控制**:让模型带引用来源、给它可检索的资料(RAG)、以及对关键结论人工核验。 ### 多模态 Multimodal 模型能同时处理多种输入形式:文字、图片、音频、视频。实际意义是你可以直接截图问「这张报错怎么修」、拍照问「这份合同哪里有坑」,不必先把内容转成文字。 ### 推理模型 Reasoning Model 在回答前先生成一段内部思考过程再给结论的模型(如 o 系列、DeepSeek-R1、Claude 的扩展思考)。在数学、代码、多步逻辑上明显更准,代价是**更慢、更贵**。日常问答不需要,复杂问题值得。 ## 二、使用层面:提示词与上下文 ### 提示词 Prompt 你给模型的输入。有效结构是**角色 + 背景 + 任务 + 格式**。比「写得好一点」有效得多的做法是:贴一段你认为好的示例——模型模仿模式的能力远强于理解形容词。 ### 系统提示词 System Prompt 优先级高于对话内容的一层指令,用来设定模型的身份、边界和输出规范。你在 ChatGPT 里设置的「自定义指令」、在 Claude Project 里写的说明,都属于这一层。 ### 少样本提示 Few-shot Prompting 在提示词里给 2 到 5 个「输入→输出」示例,让模型照着格式做。处理批量、格式固定的任务时,这是性价比最高的技巧,通常比微调先值得一试。 ### 思维链 Chain-of-Thought, CoT 让模型「一步一步想」再给答案。对多步推理任务准确率提升明显。推理模型已经把这个过程内置了,所以对它们再喊「一步步想」意义不大。 ### 温度 Temperature 控制输出随机性的参数。低(0 到 0.3)更稳定、适合提取信息和写代码;高(0.8 以上)更多样、适合头脑风暴。要可复现的结果就调低。 ### 提示词注入 Prompt Injection 攻击者把恶意指令藏在模型会读到的内容里(网页、邮件、PDF),劫持它的行为。**这是 Agent 时代最现实的安全问题**:只要模型能读外部内容又能动手做事,就存在这个风险。原则是不要给 Agent 超出任务所需的权限。 ## 三、构建层面:RAG、Agent、MCP ### RAG(检索增强生成) Retrieval-Augmented Generation 先从你的文档库检索相关片段,再让模型基于这些片段回答。**让模型用上私有资料和最新信息的标准做法**,同时因为答案有出处,幻觉率明显下降。缺点是效果高度依赖检索质量——检索不到,模型照样瞎编。 ### Embedding(向量嵌入) Embedding 把文本转成一串数字(向量),语义相近的文本向量距离也近。这是「按意思搜索」而非「按关键词搜索」的基础,也是 RAG 的第一步。 ### 向量数据库 Vector Database 专门存储和检索向量的数据库(Pinecone、Milvus、Qdrant、pgvector 等)。作用是在几百万条内容里快速找出语义最相近的几条。数据量不大时,普通数据库加向量插件通常就够。 ### 重排 Reranking 向量检索先粗筛出几十条候选,再用更精确的模型给它们重新排序,只把最相关的几条交给大模型。RAG 效果不好时,加重排往往比换更强的大模型更有效。 ### Agent(智能体) AI Agent 能自主拆解任务、调用工具、根据结果决定下一步的 AI 程序。与单轮问答的本质区别是它有**循环**:行动 → 观察结果 → 修正 → 再行动。AI 编程助手能自己跑测试、看报错、改代码,就是这个机制。 ### 工具调用 Function Calling / Tool Use 模型输出一个结构化请求,由外部程序执行(查数据库、发邮件、调 API),再把结果返回给模型。这是 Agent 能真正「做事」而不只是「说话」的关键接口。 ### MCP Model Context Protocol Anthropic 提出的开放协议,用一套统一标准把外部数据源和工具接入 AI 应用。价值在于避免 N 个工具 × M 个客户端的重复集成——写一个 MCP Server,所有支持 MCP 的客户端都能用。 ### 评测 Evals 用一组固定测试用例衡量 AI 系统的输出质量。**这是 AI 项目从「感觉还行」走向能上线的分界线**:没有评测,你改了提示词也不知道是变好还是变差。 ## 四、模型层面:训练、微调与压缩 ### 预训练 Pre-training 在海量通用文本上训练基础模型的阶段,成本极高(千万到数亿美元级),产出的是「什么都懂一点但不听指挥」的基础模型。 ### 后训练与对齐 Post-training / Alignment 让基础模型变得听话、有用、安全的阶段,包含指令微调和基于人类反馈的强化学习(RLHF)。你日常用到的模型都是后训练过的版本。 ### 微调 Fine-tuning 在通用模型上用自己的数据继续训练。**适合改变行为**(固定输出风格、格式、分类标准),**不适合灌输知识**——要让模型知道最新的公司资料,用 RAG 更便宜也更好维护。 ### LoRA Low-Rank Adaptation 只训练一小部分新增参数的轻量微调方法,显存和成本大幅下降,产出的适配器文件只有几十 MB,可以随时挂载或卸下。目前个人和小团队做微调的默认选择。 ### 蒸馏 Distillation 用大模型的输出去训练小模型,让小模型在特定任务上接近大模型的表现,但更快更便宜。很多「小而强」的模型都是这么来的。 ### 量化 Quantization 把模型权重从高精度压到低精度(如 16 位降到 4 位),体积和显存占用大幅下降,质量有轻微损失。本地跑模型的核心手段——4-bit 量化能让原本需要专业显卡的模型跑在消费级显卡上。 ### 开源权重模型 Open-weight Model 公开模型权重、可自行下载部署的模型(Llama、Qwen、DeepSeek、Mistral 等)。注意「开源权重」不等于「开源」:训练数据和训练代码通常并不公开,许可协议也各有限制。 ## 五、算力与部署 ### 推理 Inference 模型训练完成后实际生成回答的过程。训练是一次性大额投入,**推理是长期持续成本**——所以一个产品能不能规模化,往往取决于单次推理成本。 ### 本地部署 Local / On-device 在自己的电脑或服务器上运行模型(Ollama、LM Studio、vLLM)。优点是数据不出本机、无调用费用;代价是需要显存、速度和能力通常不及顶级云端模型。数据敏感时这是唯一选项。 ### 算力租赁与「显卡期货」 GPU Rental / GPU Futures 按小时租用 GPU 的平台(Vast.ai、RunPod、Lambda Labs)让个人也能用上 H100 级算力,无需一次性买卡。「显卡期货」指提前预订、锁定未来一段时间算力的模式,逻辑类似商品期货,是应对高端 GPU 长期供不应求的一种手段。站内[算力行情板块](https://usefulai.cloud/#invest)跟踪主流 GPU 的实时租赁价格。 发现错误或觉得某个词该补进来?欢迎邮件告诉我们: [coolcahng@gmail.com](mailto:coolcahng@gmail.com)。术语表会持续更新。 [三分钟搞懂 AI 是怎么回事 → 深度学习、模仿学习、强化学习,以及大模型到底在做什么。](https://usefulai.cloud/#primer) [AI 工具推荐 → ChatGPT、Claude、Perplexity、Cursor、DeepSeek、Kimi 怎么选。](https://usefulai.cloud/#tools) [Useful AI (English) → What makes AI useful, and what just demos well.](https://usefulai.cloud/en/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/about/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [Useful AI](https://usefulai.cloud/) › 关于我 About · Useful AI # 这里写的不是百科,是判断 **Useful AI**(**实用 AI**)由一线 AI 工程师运营,是一份个人判断集合: 不卖课、不做咨询、不接软广——只把真实落地过程中验证过、敢署名负责的东西写清楚。 最近更新:2026 年 8 月 18 日 · [English version](https://usefulai.cloud/en/) ## 方法论:认知差 > 信息差 很多人问这个站和 AI 资讯站有什么区别。区别在三句话里: - **信息差已经死了。**「知道一个消息、别人不知道」——AI 与聚合器早就把这一点抹平, 再快的搬运也不产生增量价值。所以这个站不追求快,追求的是「同样一条消息,给出不一样的解读」。 - **认知差才稀缺。**大家都知道同一个消息,但能看到它背后的底层逻辑,并得出一个与众不同 的结论,才是稀缺的部分。这里所有内容都按这个标准生产:不是「发生了什么」,而是「这意味着什么、会怎么演化」。 - **「独特判断」在这里是褒义词。**内容的价值在于对这个世界有逻辑支撑、敢被证伪的独立 结论,而不是面面俱到的百科式覆盖。哪怕观点在当下有争议,它也会筛出最精准的读者,并让 AI 在引用时 把它当作一个「重要侧面」点名,而不是淹没在共识里。 ## 怎么写:亲手验证,定义自己的标准 - **工具都亲自用过。**写进推荐列表的工具,都在真实任务上跑过至少一轮完整流程,而不是 看官网介绍转述。没有亲手验证过的结论,不会写。 - **带真实代价的总结。**「实测发现」「跑下来的教训」这类带着真实使用成本的总结, 是 AI 最难模拟、也最值得花时间读的部分。 - **定义自己的框架,而不是追随行业共识。**「可验证性定律」(判断 AI 能否接手一件事的唯一标准)、 「三种学法三种失效」(预判 AI 在哪一步掉链子)、「闭环大于参数」「第三章定律」「体感会骗你」—— 这些是本站提出并持续打磨的判断框架,也是这个站的标签。可以不同意,但讨论它们时会引用到这个站。 - **结论标注适用范围。**「适合谁、不适合谁」比「最好的 X」更有用,所以尽量写清边界。 - **时间敏感的内容标注日期。**模型和价格变化极快,过期的结论比没有结论更糟。 - **会写缺点。**幻觉、上下文限制、隐私风险、隐性成本——这些不写清楚,推荐就没有意义。 ## 背景 数学系本科,计算机硕士,2019 年毕业后先后任职于互联网与智能汽车领域。以系统集成与功能开发为主、 数据驱动方法为辅,负责核心功能的开发与落地。工作涵盖信号处理、系统分析与控制开发等方向,同时推动 开发过程中的工具链建设与流程优化。 ### 主要工作 - **智能感知与状态估算**:基于多源传感器融合,对车辆状态与行驶环境进行实时估算, 持续优化精度与鲁棒性,为控制系统提供可靠输入。 - **运动控制功能开发**:参与新功能的系统方案制定、控制策略设计与模型开发集成; 建立客观评价体系,把主观驾乘体验映射为可量化的工程指标。 - **开发工具链与知识体系建设**:搭建数据分析与问题诊断流程,开发自动化测试与过程 管理工具,沉淀技术知识体系。 ## 为什么用 FDE 的视角写 AI **前向部署工程师(Forward Deployed Engineer,FDE)**是 AI 落地中逐渐被采纳的一种工作方式: 工程师不在远端交付,而是直接坐进业务现场。 - **贴身理解需求**:与一线业务人员共同梳理流程与痛点,把模糊诉求翻译成可被 AI 求解的 具体任务,避免「隔层传话」造成的信息衰减。 - **极速原型验证**:结合 Prompt 工程、RAG、Agent 编排与工具调用,把过去需要数周的 POC 压缩到几天甚至几小时,用可交互原型替代冗长方案文档。 - **端到端落地闭环**:从数据接入、评测标准、系统集成到上线运维一并负责,让能力真正嵌入 业务链路,而不是停在「看起来很酷」的演示阶段。 **图解 13**: 为什么多数 AI 原型上不了线:传统交付 vs FDE (适合:工程师 / 团队负责人) 大多数 AI 原型上不了线,**问题不在模型能力,而在三处断点**:需求隔层传话、拿干净样本演示、没有评测与集成方案。FDE 的做法就是把这三处各修一次——**进现场**、**第一天就用真实数据**、**同一人负责到上线运维**。这也是本站内容的一条主线:判断一个 AI 能力有没有用,标准不是跑分或演示效果,而是它能不能在真实数据、真实流程里活下来。 这也是本站内容的一条主线:判断一个 AI 能力有没有用,标准不是跑分或演示效果,而是它能不能在真实 数据、真实流程里活下来。 ## 不做什么 - 不做无观点的资讯搬运——信息差的钱不赚,也不想赚。 - 不卖课程、不做付费咨询、不做「AI 变现」这类内容。 - 不接未标注的商业推广。 - 不提供投资建议。站内的 GPU 算力行情与科技投资板块是行业观察,不构成任何买卖建议。 ## 联系方式 - 邮箱:[coolcahng@gmail.com](mailto:coolcahng@gmail.com) - GitHub:[github.com/CarryChang](https://github.com/CarryChang) - 小红书:[TechGuy数字卡斯克 · Useful AI](https://www.xiaohongshu.com/user/profile/5bbc2e923c2ad90001aab359?xsec_token=ABf9Qv7gXL0vLsILCxX31c1qHj6b0FMzHUbyxU6H60L98%3D&xsec_source=pc_search) 内容纠错、事实更正、合作与转载授权,都欢迎直接发邮件。 ## 常见问题 ### Useful AI 是什么,和其他 AI 资讯站有什么区别? Useful AI(实用 AI)是一线 AI 工程师运营的判断集合,不是百科全书。区别在于本站的立场是「认知差 > 信息差」——不追求比谁更快搬运消息,只发布亲手验证过、敢署名负责的判断,目标是提供独特甚至反直觉的观点,而不是复述行业共识。 ### 这个站是谁运营的? 运营者是 CarryChang,数学系本科、计算机硕士,2019 年起先后任职于互联网与智能汽车领域,负责智能感知、运动控制与 AI 工程化落地,日常以前向部署工程师(FDE)的方式工作。本站不卖课、不做咨询、不接软广。 ### 本站的内容会不会带货或恰饭? 不会。本站明确不做无观点的资讯搬运、不卖课程、不做付费咨询、不接未标注的商业推广,也不提供投资建议——站内 GPU 算力行情与科技投资板块是行业观察,不构成任何买卖建议。 [实用 AI 指南 → AI 入门、工具推荐、免费课程、真实应用场景与算力行情。](https://usefulai.cloud/) [AI 术语表 → 大模型、Token、上下文窗口、RAG、Agent、MCP 等术语速查。](https://usefulai.cloud/glossary/) [Useful AI (English) → What makes AI useful, and what just demos well.](https://usefulai.cloud/en/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/primer/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › 认识 AI AI Primer # AI 入门:三分钟搞懂 AI 是怎么回事 不需要写代码,不需要懂数学。但也不糊弄你——**每个比方都会告诉你它在哪里失效**,因为失效的地方恰好是你会踩坑的地方。三种学法(深度学习 / 模仿学习 / 强化学习)决定了 AI 三种典型的犯错方式,搞懂它们,你对 AI 的预期就校准了。 最近更新:2026-09-13 · 作者:[UsefulAI](https://usefulai.cloud/about/) AI Primer ## 三分钟搞懂 AI 是怎么回事 不需要写代码,不需要懂数学。但也不糊弄你——每个比方我都会告诉你它在哪里失效,因为失效的地方恰好是你会踩坑的地方。 **图解 01**: 三种学法,三种固定的犯错方式 (适合:初中起可读) 三种学法不是三代技术,而是同时并存的三块拼图,今天的大模型三样都用。**看图的正确方式是从下半部分读起**:AI 的每一种错误都不是随机的,而是它学习方式的必然产物——**深度学习**让它在陌生场景里自信答错,**模仿学习**让它在长任务里越走越偏,**强化学习**让它倾向于顺着你说话。知道这三种错法,你对 AI 的预期就校准了。 01 ### 深度学习:不是「懂了」,是把函数拟合对了 传统程序是人写规则;深度学习反过来——你给它几百万张猫的照片和「是猫 / 不是猫」的答案,它自己调整内部上亿个参数,直到输入照片能输出正确答案。所谓「神经网络」,就是这堆参数的组织方式:浅层抓边缘和颜色,深层抓五官和轮廓。 关键在于:它学到的是**相关性**,不是因果。它不知道「猫」是一种动物,只知道哪些像素组合会让答案变对。ChatGPT、Claude 底层都是这套机制。 **这个比方哪里不对:** 常见的说法是「像小孩看多了猫就认识猫」。但小孩看几十只就够了,模型要几百万张——因为小孩用的是因果和常识,模型用的是统计。这也决定了模型的失效方式:**训练数据里没见过的分布,它会自信地答错**。我做车辆感知那几年,难的从来不是常见场景,而是长尾——雨夜、逆光、施工路段这些占比 1% 的情况,吃掉了 90% 的工程量。你用 AI 时也一样:它在常见任务上像专家,在冷门角落里会突然变成外行,而且语气一样自信。 02 ### 模仿学习:上限是师傅,风险是越错越远 有些任务没法用规则写:开车、下厨、写一封得体的邮件。模仿学习的做法是让模型观察大量人类示范,学「这种情况下人会怎么做」。自动驾驶这样训练,大模型的「监督微调」(SFT)本质上也是这个——让模型模仿人类写的优质回答。 它有两个绕不开的问题。一是**上限等于示范者**:数据里的师傅是平庸的,模型就学出平庸。二是**误差累积**:模型一旦偏离示范里出现过的状态,后面就进入没学过的区域,错误会越滚越大。 **这对你意味着什么:** 这解释了一个你天天遇到的现象——让 AI 干长任务,前几步很漂亮,越往后越离谱。不是它「累了」,是它偏出了熟悉的轨道。**对策不是把提示词写得更长,而是把任务切短、每步都给它看到真实结果**。这是我在做 Agent 落地时反复验证的一条:能查看中间产物的流程,比一次性交代清楚的流程可靠得多。 03 ### 强化学习:你写的奖励,就是它真正的目标 没有老师也没有示范怎么办?让模型自己试,做对给奖励,做错给惩罚,反复迭代找出策略。AlphaGo 靠自我对弈几百万盘超越了人类棋手——这是强化学习最强的地方:**它能突破人类示范的上限**。今天的编程 Agent 能自主「写→跑→报错→改」,同样靠这套机制。 但强化学习的全部风险都压在一句话上:**模型优化的是你写下的奖励,不是你心里想的目标**。奖励定得稍有偏差,它就会找到你没预料到的捷径去拿高分。 **为什么 AI 老是顺着你说话:** 大模型的最后一步训练(RLHF)用的奖励,是「人类标注员更喜欢哪个回答」。而人类往往更喜欢自信、顺从、结构漂亮的回答——于是模型就学会了讨好,而不是学会正确。这不是 bug,是奖励设计的必然结果。所以当 AI 说「你说得对」,那不是它同意你,那是它拿分。**把判断权交回自己手上,这是使用 AI 最基本的自我保护。** 04 ### 大模型:说它「只是接龙」和说它「会思考」,都不准确 大模型的训练目标确实是「预测下一个词」。但训练目标不等于能力描述——为了把这件事做到极致,模型不得不在参数里压缩进语法、常识、代码结构、推理套路。这就像说「人类的目标只是繁衍」:技术上没错,但用它解释不了任何具体行为。 更有用的理解是:**它把海量文本压缩成一个函数,然后按概率采样生成**。「按概率生成」这四个字解释了它几乎所有怪异行为。 **幻觉不是缺陷,是同一个机制的另一面:** 模型被训练成「产出看起来最合理的下一段文字」,从来没有一个训练信号教它「这里我其实不知道」。所以遇到知识空白,它不会停,它会补一段最像真的内容出来。这意味着幻觉**无法被彻底消除,只能被控制**:给它可检索的资料(RAG)、用带引用来源的工具、对关键结论人工交叉验证。任何声称「彻底解决幻觉」的产品,都值得你多问一句怎么做到的。 **图解 02**: 幻觉是怎么产生的:它每一步只在「挑最像真的那个词」 (适合:高中 / 工程师) **幻觉不是 bug,是这套机制的另一面。**模型的训练目标是「让下一个字看起来最合理」,而不是「说真话」——所以遇到知识空白,它不会停下来,只会补一段最像真的内容。这也说明了控制幻觉的三个正确方向:**给它可检索的资料(RAG)**、**用带引用来源的工具**、**关键结论人工交叉验证**。任何声称彻底消除幻觉的说法,都要先问它改动了这套机制的哪一步。 05 ### 提示词:别当咒语,当规格说明书 同一个模型,说「帮我写个东西」和说「你是资深编辑,给科技媒体写一篇 800 字评测,语气轻松但数据扎实」,结果差距巨大。但市面上的提示词技巧大半是无效的——**堆形容词没用**。「专业的」「高质量的」「深度的」这类词,模型无法据此改变任何行为。 真正有效的只有三件事:给**上下文**(它不知道的背景)、给**示例**(一个「好答案」长什么样)、给**可验证的输出格式**(表格、JSON、固定小节)。 **最高性价比的一招:** 与其继续加形容词,不如贴一个你认可的样例进去。模型模仿模式的能力远强于理解形容词——这是它的训练方式决定的。写提示词的正确心态是写需求文档:**如果这段话交给一个聪明但完全不了解你处境的实习生,他会不会做错?会,那就是你该补的信息。**基础结构记住四段就够:角色 + 背景 + 任务 + 格式。 **图解 03**: 提示词的四段结构,以及哪些技巧其实无效 (适合:所有人) 把提示词当**规格说明书**写,而不是当咒语念。自检的办法很简单:**这段话交给一个聪明但完全不了解你处境的实习生,他会不会做错?**会,那就是你漏掉的信息。图右下角那条是最高性价比的一招——**与其继续加形容词,不如贴一个你认可的成品样例**,因为模仿模式正是模型最擅长的事。 06 ### 2026 年的真正变化:闭环闭上了 2024 到 2026 年最大的跃迁,不是模型变得更聪明,而是**它从「只能说」变成了「能做、能看到结果、能自己改」**——调用工具、执行代码、读取报错、重试。能力提升有很大一部分来自这个闭环,而不是参数量。 但提升是不均匀的,这点值得说清楚:**凡是有便宜验证方式的任务,AI 进步极快**(写代码有编译器和测试、解数学题有答案、翻译有对照)。**凡是没有验证器的任务,进步就慢**(战略判断、审美取舍、人际分寸)。因为强化学习需要可计算的奖励,没有奖励信号就没有快速迭代。 **一条可以直接用的判断标准:** 想知道 AI 能不能帮上你手里这件事,先问「这件事的对错,能不能低成本地验证?」能——放心交给它,你只需要检查结果。不能——它只能给你草稿和思路,最终判断还是你的。这个标准比任何工具榜单都好用,而且不会过期。 #### 📋 三句话总结 - **三种学法决定三种失效方式**——深度学习在没见过的分布上会自信答错;模仿学习在长任务里误差累积;强化学习会优化你写下的奖励而不是你想要的目标(这就是 AI 爱顺着你说话的原因) - **幻觉不可消除,只能控制**——模型没有「我不知道」这个训练信号,遇到空白就会补一段最像真的内容;对策是给资料、用带引用的工具、关键结论人工验证 - **判断 AI 能不能帮你,只看一件事**——这件事的对错能否低成本验证。能验证的任务它进步飞快,不能验证的任务它只能给草稿 ## 常见问题 ### AI 到底是怎么工作的? 大模型的训练目标是预测下一个词,为了做好这件事,它把海量文本压缩进上千亿个参数里,生成时按概率采样输出。它学到的是相关性而非因果,所以在训练数据覆盖不到的场景会自信地给出错误答案。 ### 为什么 AI 会产生「幻觉」,编造错误信息? AI 幻觉无法被彻底消除,只能被控制。模型被训练成「输出看起来最合理的下一段文字」,没有任何训练信号教它「这里我不知道」,遇到知识空白时它会补一段最像真的内容。控制方法是使用带引用来源的工具、用 RAG 给它可检索的资料,并对关键结论人工交叉验证。 ### 怎么判断一件事能不能交给 AI 做? 只看一个标准:这件事的对错能否低成本验证。能验证的任务(代码有编译器和测试、数学有答案、翻译有原文对照)可以放手交给 AI,你只需要检查结果;不能验证的任务(战略判断、审美取舍、需要担责的决定)AI 只能给草稿,最终判断仍然是你的。 ### 为什么 AI 总是顺着我说话,很少反驳我? 这是强化学习训练方式的必然结果。大模型的最后一步训练(RLHF)用「人类标注员更喜欢哪个回答」作为奖励信号,而人类往往更喜欢自信、顺从的回答,模型因此学会了讨好而不是学会正确。这不是 bug,是奖励设计决定的。 ## 继续阅读 [AI 术语表 → 大模型、Token、上下文窗口、RAG、Agent、MCP 等 30 个概念速查。](https://usefulai.cloud/glossary/) [AI 工具推荐 → ChatGPT / Claude / Gemini / Cursor 怎么选,附价格与难度对照表。](https://usefulai.cloud/tools/) [AI 能干嘛 → 四个真实场景:找资料、看专业文件、数据分析、写作。](https://usefulai.cloud/scenarios/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/tools/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › 实用工具 AI Toolkit # AI 工具推荐 2026:哪个好用、哪个免费、怎么选 不用安装、不用花钱、不用写代码——打开浏览器就能用。按**聊天搜索、编程、Agent、图像视频**四类整理,附价格与难度对照表。但先说一句实话:**模型之间的能力差距,远小于「你会不会提问」造成的差距**,先挑一个用满两周再考虑换。 最近更新:2026-09-13 · 作者:[UsefulAI](https://usefulai.cloud/about/) AI Toolkit ## 这些 AI 工具,你随时可以上手 不用安装、不用花钱、不用写代码——打开浏览器就能用。先提醒一句:模型之间的能力差距,远小于「你会不会提问」造成的差距。先挑一个用满两周,再考虑换。 **图解 08**: 第一个 AI 工具怎么挑:从任务倒推,别从榜单倒推 (适合:所有人) 选工具的正确顺序是**任务 → 工具**,不是榜单 → 工具。四条主线覆盖了绝大多数需求:**通用问答写作**、**要核对来源**、**长文档与复杂推理**、**写代码**。真正影响结果的仍然是提问质量,所以别在选型上耗太久——挑一个,用满两周,再回来看这张图。 ### 💬聊天与智能搜索 - **ChatGPT** — 最主流的 AI 对话工具,能聊天、搜索、分析文件、写代码,GPT-5.6 三档模型覆盖所有场景 (试试问它:「用小学生能听懂的话解释量子计算」) - **Claude** — 擅长处理超长文章和文档,写出来的东西更自然、更像人话,Sonnet 5 性价比极高 (试试丢一份 PDF 给它:「帮我总结这份报告的 5 个关键结论」) - **Gemini** — Google 的 AI 助手,深度整合搜索、邮箱、文档等 Google 全家桶,3.5 Flash 速度极快 (试试说:「帮我整理 Gmail 里这周的未读重要邮件」) - **Perplexity** — AI 搜索引擎,回答问题的同时给出信息来源,再也不用自己翻网页了 (试试搜索:「2026 年最值得学的 3 个技能」) ### ⌨️编程与做网站 - **Cursor** — AI 写代码工具,能理解你整个项目的代码,帮你自动写、改、调试 (适合有一点编程基础的人,效率能翻好几倍) - **Claude Code** — Anthropic 推出的 AI 编程代理,在终端中运行,能理解整个代码库、自动编辑文件、运行命令、甚至提交 Git,像有个结对程序员 (试试说:「帮我重构这个模块,添加单元测试」) - **Codex** — OpenAI 的编程代理,在云端沙盒环境中运行,能写功能、修 bug、回答代码问题、自动提交 PR,支持 Slack 协作 (适合团队:在 Slack 里 @Codex,让它自动完成任务) - **Lovable / Bolt** — 完全不会代码也能用——描述你想要的网站或应用,AI 直接帮你生成出来 (试试说:「帮我做一个个人作品集网站,风格简约」) ### 🤖智能代理 Agent - **ChatGPT Agent** — OpenAI 的智能代理,能在虚拟计算机上自主完成复杂工作流——从研究到执行,一条指令搞定 (试试说:「帮我调研竞品,整理成报告发到邮箱」) - **Devin** — AI 软件工程师,能自主规划、编码、调试整个开发任务,从需求到上线全程自动化 (适合团队:把一整个功能交给它,像给初级工程师派活) - **OpenClaw** — 开源 AI 代理框架,能持续运行、记住上下文、自动执行跨应用任务——从聊天到行动的关键一步 (适合进阶用户:在自己的设备上部署,让 AI 自动处理日常任务) ### 🎨画图与做视频 - **Midjourney / DALL-E** — 输入文字描述就能生成超精美的图片,从插画到照片级图像都行 (试试:「一只穿宇航服的猫在月球上喝咖啡,电影质感」) - **Seedance / Kling** — 2026 年最强 AI 视频生成——文字/图片直接变电影级短片,已有导演用它拍出 13 分钟完整短片 (上传一张照片,让它「动起来」,效果已经很接近真实拍摄) ### 一张表看清:主流 AI 工具怎么选? | 工具名称 | 类型 | 最适合做什么 | 价格(2026.07) | 难度 | | --- | --- | --- | --- | --- | | ChatGPT | 通用对话 | 日常问答、写作、分析 | 免费 / Go $8 / Plus $20 / Pro $200 | ⭐ | | Claude | 长文档处理 | 论文分析、长文写作、代码 | 免费 / Pro $20 / Max $100-200 | ⭐ | | Gemini | Google 生态 AI | 搜索整合、邮件、文档协作 | 免费 / Plus $8 / Pro $20 / Ultra $100 | ⭐ | | Perplexity | AI 搜索 | 带来源的事实查询 | 免费 / Pro $20 / Max $200 | ⭐ | | Cursor | AI 编程 | 写代码、改代码、调试 | 免费 / Pro $20 / Pro+ $60 / Ultra $200 | ⭐⭐ | | Claude Code | AI 编程代理 | 终端里的 AI 程序员 | Pro $20 / Max $100-200 | ⭐⭐⭐ | | Codex | AI 编程代理 | 云端沙盒自动编码 | 含 ChatGPT Plus/Pro | ⭐⭐ | | Devin | AI 软件工程师 | 自主完成整个开发任务 | 免费 / Pro $20 / Max $200 | ⭐⭐ | | Midjourney | AI 绘画 | 文字生成精美图片 | $10 / $30 / $60 / $120 月 | ⭐⭐ | #### 📋 选工具的三条实用原则 - **按场景选,别按榜单选**——日常通用 ChatGPT,长文档与写作 Claude,Google 生态 Gemini,要引用来源 Perplexity;编程 Cursor / Claude Code / Codex,整包任务 Devin。榜单分数的差距,通常小于你换一次提问方式带来的差距 - **Agent 类工具的门槛不在会不会用,在敢不敢授权**——它能改文件、跑命令、发请求。先在能随时回滚的环境里(干净的 Git 分支、隔离目录)验证它的行为边界,再逐步放开权限。这一步省不掉 - **先用免费版把用法练熟,再谈付费**——付费的分界线是「免费额度开始打断你的固定流程」,不是「听说付费版更强」。编程 Agent 是例外,它的算力消耗量级不同,认真用几乎必然要付费 ## 常见问题 ### 2026 年新手第一个该用哪个 AI 工具? 推荐 ChatGPT,界面最简单、功能最全面,日常问答、写作、分析都能覆盖,而且有免费版。先用满两周把用法练熟,再考虑是否需要换成其他工具,不要一开始就在多个工具之间来回试。 ### ChatGPT、Claude、Gemini、Perplexity 到底怎么选? 按场景选:日常通用问答选 ChatGPT,处理长文档和复杂推理选 Claude,需要带引用来源的搜索选 Perplexity,深度整合 Google 生态(Gmail、Docs)选 Gemini。这几个都有免费版,工具之间的能力差距,通常小于「你会不会提问」带来的差距。 ### AI 编程工具(Cursor、Claude Code)值得学吗? 值得,但前提是先在能随时回滚的环境里用。Cursor 和 Claude Code 能理解整个项目代码、自动写改调试,效率提升明显,但它们能改文件、跑命令,第一次用建议在干净的 Git 分支上验证行为边界,再逐步放开权限。 ### AI 工具都要付费吗? 不需要。ChatGPT、Claude、Gemini、Perplexity 的基础版都免费,日常需求完全够用。付费的分界线是「免费额度开始打断你的固定流程」,而不是「听说付费版更强」。编程类 Agent 是例外,认真用几乎必然要付费。 ## 继续阅读 [免费 AI 课程 → 李宏毅、李沐、学堂在线、Stanford、MIT 等 11 个国内可直接访问的免费学习来源。](https://usefulai.cloud/courses/) [AI 能干嘛 → 四个真实场景:找资料、看专业文件、数据分析、写作。](https://usefulai.cloud/scenarios/) [AI 术语表 → 大模型、Token、上下文窗口、RAG、Agent、MCP 等 30 个概念速查。](https://usefulai.cloud/glossary/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/courses/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › 免费课程 Free Courses # 免费 AI 课程汇总:国内可访问的公开资源 我们正处在技术和应用的奇点——AI 能力已经足够强大,顶级高校和公开课作者也在把知识免费开放给所有人。这里筛选的全部来源国内均可直接访问,不需要额外的网络环境。**零基础**从学堂在线、李宏毅机器学习开始;**想懂原理**看 Stanford、MIT 公开课与邱锡鹏、王树森的中文教材;**想动手练**用 fast.ai、NVIDIA DLI 和李沐的动手学深度学习,学完还能拿证书。 最近更新:2026-09-13 · 作者:[UsefulAI](https://usefulai.cloud/about/) Free Courses ## 大厂免费 AI 课程,跟着学就对了 我们正处在技术和应用的奇点——AI 的能力已经足够强大,而大厂们正在把知识免费开放给所有人。这本身就在说明:这个时代不一样了。 **图解 09**: 三条免费学习路径:按你现在的位置选,不要贪多 (适合:学生 / 转型工程师) 这些课程全都免费、且国内均可直接打开,所以真正的稀缺资源是**你的注意力**。按现在的位置选一条:**只想会用**走 A,**想读懂论文**走 B,**想尽快转型**走 C。三条路径的产出不同,但失败方式是同一个——同时开三条、一条都没做完。先把一条走完,再决定下一步。 🟣 ### 李宏毅机器学习 (强烈推荐) 台湾大学李宏毅老师的机器学习与生成式 AI 课程,讲解清晰、案例贴近实际,B 站有完整搬运,国内访问零障碍——是我首推的中文学习起点。 - [机器学习 2021 — — 深度学习基础全讲解](https://www.bilibili.com/video/BV1Wv411h7kN) - [生成式 AI 导论 2024 — — 大模型原理与应用](https://speech.ee.ntu.edu.tw/~hylee/genai/2024-spring.php) - [课程主页 — — 历年课件与作业](https://speech.ee.ntu.edu.tw/~hylee/ml/2023-spring.php) [开始学习 →](https://speech.ee.ntu.edu.tw/~hylee/) 🔵 ### 李沐·动手学深度学习 (推荐) 亚马逊资深科学家李沐主讲,配套开源教材《动手学深度学习》,代码可直接跑,B 站视频完整免费,中文社区活跃。 - [动手学深度学习 — — 在线教材 + 代码](https://zh.d2l.ai/) - [配套视频课 — — B 站完整讲解](https://www.bilibili.com/video/BV1if4y147hS) - [GitHub 源码 — — 可运行的 Notebook](https://github.com/d2l-ai/d2l-zh) [开始学习 →](https://zh.d2l.ai/) ⚫ ### 学堂在线 (推荐) 清华大学发起的中文慕课平台,汇集国内外高校的人工智能、机器学习课程,注册即用,适合想要系统学习的人。 - [人工智能导论 — — 多所高校开设](https://www.xuetangx.com/) - [机器学习 — — 系统性理论课程](https://www.xuetangx.com/) - [深度学习实践 — — 配套编程作业](https://www.xuetangx.com/) [开始学习 →](https://www.xuetangx.com/) 🟢 ### Microsoft (推荐) 体系最完整的 AI 学习平台。从 AI 基础到 Copilot 应用,按角色定制学习路径。 - [AI Fundamentals — — Azure AI 基础](https://learn.microsoft.com/en-us/ai/) - [Generative AI 入门 — — 生成式 AI 概念](https://learn.microsoft.com/en-us/training/modules/fundamentals-generative-ai/) - [AI Agents 构建 — — 从零到生产](https://learn.microsoft.com/en-us/ai/) [开始学习 →](https://learn.microsoft.com/en-us/ai/) 🔴 ### DeepLearning.AI (进阶) Andrew Ng(吴恩达)创办。深度学习的黄金课程,如果你想理解 AI 的底层原理。 - [深度学习专项 — — 神经网络到 CNN](https://www.deeplearning.ai/) - [Prompt Engineering — — 开发者提示工程](https://www.deeplearning.ai/) - [LangChain — — 构建 LLM 应用](https://www.deeplearning.ai/) [开始学习 →](https://www.deeplearning.ai/) 🟡 ### 邱锡鹏《神经网络与深度学习》 (进阶) 复旦大学邱锡鹏教授的开源教材与配套课程,中文原创、体系完整,覆盖从基础理论到 Transformer 的全部内容。 - [神经网络与深度学习 — — 开源教材 PDF](https://nndl.github.io/) - [GitHub 仓库 — — 理论书 + 通识版](https://github.com/nndl/nndl) - [习题讨论 — — 课后习题答案交流](https://github.com/nndl/nndl-discussion) [开始学习 →](https://nndl.github.io/) 🟥 ### Stanford 公开课 (进阶) 斯坦福最热门的 AI 课程,视频和作业全部免费公开,想深入理解 AI 底层原理必看。 - [CS231n — — 深度学习与计算机视觉](https://cs231n.stanford.edu/) - [CS224n — — 自然语言处理](https://web.stanford.edu/class/cs224n/) - [CS234 — — 强化学习](https://web.stanford.edu/class/cs234/) - [CS25 — — Transformers United 前沿研讨](https://web.stanford.edu/class/cs25/) [开始学习 →](https://cs231n.stanford.edu/) ⬜ ### MIT 6.S191 (进阶) MIT 深度学习入门课,2026 新版已上线。一周时间建立对神经网络的完整认知,节奏紧凑、讲解清晰。 - [深度学习基础 — — 神经网络、CNN、RNN](https://introtodeeplearning.com/) - [Transformer 与注意力 — — 大模型核心架构](https://introtodeeplearning.com/) - [AI for Medicine — — 医疗 AI 应用](https://introtodeeplearning.com/) [开始学习 →](https://introtodeeplearning.com/) 🟧 ### fast.ai (实战) 「先动手再懂原理」的实战派课程。会写一点 Python 就能上手,从零到训练自己的模型只需几小时。 - [Practical Deep Learning — — 实战深度学习](https://course.fast.ai/) - [How to Solve it With Code — — 用代码解决问题](https://www.fast.ai/) [开始学习 →](https://course.fast.ai/) 🟩 ### NVIDIA DLI (实战) GPU 计算巨头的免费实验课,在真实云 GPU 上动手训练模型,学完还能拿证书。 - [深度学习入门 — — 从零训练神经网络](https://resources.nvidia.com/en-us-nvidia-training/free-courses) - [Generative AI Explained — — 生成式 AI 原理](https://resources.nvidia.com/en-us-nvidia-training/free-courses) - [RAG Agents — — 构建检索增强智能体](https://resources.nvidia.com/en-us-nvidia-training/free-courses) [开始学习 →](https://resources.nvidia.com/en-us-nvidia-training/free-courses) 🟨 ### 王树森·深度强化学习 (进阶) 前亚马逊科学家王树森的深度强化学习公开课,覆盖价值学习、策略学习、Actor-Critic 到 AlphaGo,讲义与视频均为中文、B 站可直接看。 - [课程讲义 — — slides + lecture notes](https://github.com/wangshusen/DRL) - [B 站视频 — — 中文完整讲解](https://www.bilibili.com/video/BV12o4y197US) [开始学习 →](https://github.com/wangshusen/DRL) #### 📋 三句话总结 - **零基础入门**——学堂在线、李宏毅机器学习、Microsoft AI 基础不需要编程背景,跟着做就行,国内均可直接访问 - **想懂原理**——Stanford、MIT 顶级公开课,加上邱锡鹏、王树森的中文开源教材,深度学习 / 强化学习一次覆盖 - **想动手练**——fast.ai、NVIDIA DLI 和李沐的动手学深度学习让你在真实环境里训练模型,学完还能拿证书 ## 常见问题 ### 零基础学 AI,应该先看哪个免费课程? 推荐从李宏毅的机器学习课程开始,B 站有完整搬运、国内访问零障碍,从基础理论到生成式 AI 都覆盖了。学堂在线和 Microsoft AI 基础也适合非技术背景,跟着做就能建立基础认知。 ### 想深入理解 AI 底层原理,该看什么课? 需要一定数理基础的话,Stanford CS224n(NLP)、CS231n(计算机视觉)和 MIT 6.S191(深度学习)是公认的顶级免费公开课,视频和作业全部开放;中文资料可以搭配邱锡鹏的《神经网络与深度学习》和王树森的深度强化学习课程,原理讲得同样扎实。 ### 为什么免费课程都学了,还是不会用 AI? 这是本站观察到的「第三章定律」:按目录顺序刷课的人,绝大多数停在第三章,因为资源从来不是瓶颈,真实任务才是。正确的做法是反过来——先挑一件本周要交付的真实工作任务,拿 AI 去做,卡住了再回去查对应的课程内容。 ## 继续阅读 [AI 入门 → 三分钟搞懂深度学习、模仿学习、强化学习和大模型在做什么。](https://usefulai.cloud/primer/) [AI 工具推荐 → ChatGPT / Claude / Gemini / Cursor 怎么选,附价格与难度对照表。](https://usefulai.cloud/tools/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/scenarios/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › AI 能干嘛 Real Scenarios # AI 能干嘛?四个真实场景看清它的价值 别看技术参数了。这四件事我都在真实项目里做过,所以除了「它能干什么」,更要讲清**它在哪一步会掉链子**——知识检索的瓶颈在检索不在模型;专业文件它能翻译不能判断;数据分析最容易错的是口径而不是数值;写作省掉的是初稿,不是定稿。 最近更新:2026-09-13 · 作者:[UsefulAI](https://usefulai.cloud/about/) Real Scenarios ## AI 能帮你做什么?四个场景,连坑一起讲 这四件事我都在真实项目里做过。所以除了「它能干什么」,我更想告诉你「它在哪一步会掉链子」——那才是决定你用得下去还是放弃的地方。 🔍 (工作效率) ### 企业知识检索:决定成败的不是模型 公司文档散落在飞书、Notion、邮件、几年前的共享盘里。每次找一条制度或历史方案,都要翻半天,还经常翻到过期版本。 做法是把文档统一切块、建索引,你提问时系统先**检索**出最相关的几段,再让模型基于这几段作答并标出出处。这套东西叫 RAG。体感上确实是从翻十几分钟变成半分钟,而且答案能溯源。 **真正的坑在检索,不在模型:** 我见过的失败案例里,绝大多数问题出在检索环节——文档切块切断了上下文、没有标题和日期这类元数据、没做重排序、过期文档和现行文档权重一样。换更强的模型对这些一点用都没有。**更要紧的一点:文档本身是错的,AI 只会让你更快地拿到错答案。** 上线前请务必先攒一份 50 道题的问答集,量一下检索命中率,别拿「看起来会回答」当验收标准。这一条几乎能决定项目生死。 **图解 04**: 企业知识检索(RAG)的真实管线:坑在中间那一段 (适合:工程师向) ```mermaid flowchart LR A["01 文档切块
保留标题与日期"] --> B["02 建向量索引
Embedding"] B --> C["03 检索候选
Top-K 片段"] C --> D["04 重排序
过期文档降权"] D --> E["05 带出处作答
可溯源"] subgraph 失败集中区["⚠ 90% 的失败集中在这一段 — 换更强的模型救不了"] A B C D end F["⚠ 文档本身是错的 → AI 只会更快给你错答案"] G["✓ 验收标准:50 题问答集 + 检索命中率"] ``` 这张图想说的只有一句话:**RAG 的成败在检索,不在模型。**切块切断了上下文、缺少标题和日期这类元数据、没做重排序、过期文档和现行文档权重一样——这四件事里任何一件出问题,换多强的模型都救不回来。**上线前先攒 50 道题量检索命中率**,别拿「看起来会回答」当验收标准。 🏥 (专业领域) ### 看懂「天书」:它擅长翻译,不擅长判断 体检报告上的术语看不懂,合同条款读不下去,财报里的数字不知道哪个重要。 把文件丢给 AI,它能把「窦性心律,ST 段压低」翻成人话,能把合同里的关键义务和风险条款拎出来。这类任务它做得好是有原因的:**术语翻译和结构化提取,本质上是文本到文本的映射,正好是模型最强的能力**。 **边界要说清楚:** 它读得懂写在纸上的东西,但专业判断常常来自**没写在纸上的东西**——你的病史、这份合同的谈判背景、这家公司的行业惯例。模型对缺失信息毫无感知,也不会提醒你「这里还缺一项检查」。所以正确用法是**用它把自己从「完全看不懂」抬到「能问出好问题」**,然后带着这些问题去见医生和律师。它省掉的是你的信息不对称,不是专业人士的判断。医疗、法律、财税上的决定,别让概率模型替你拍板。 📈 (数据决策) ### 不会 Excel 也能分析:但要盯住口径 老板要一份数据报告,你不会写公式、不会做图,面对一张几万行的表不知从哪下手。 把文件传给 AI,用大白话说「看看上个月哪个产品卖得最好、哪个地区在下滑,出几张图」。它会写代码去算、画图、给结论。注意这里的机制:**它是写程序算出来的,不是「心算」出来的**——所以数值运算本身通常是可靠的。 **最容易翻车的不是算错,是口径错:** 它不知道你公司的「活跃用户」是登录过还是下过单,不知道你的财月从哪天起算,不知道那批测试订单要剔除。口径一错,算得再准也是废的,而且看起来非常专业——这比明显报错危险得多。**两个习惯能挡掉大部分问题:一是让它先复述一遍口径和过滤条件、你确认后再算;二是要求它把 SQL 或 Python 代码打出来。** 代码是可审查的,结论不是。这也是我在工程上一直坚持的:宁可要一个能被检查的过程,不要一个漂亮的答案。 ✍️ (创意生产) ### 写东西:初稿变便宜了,定稿没有 要写一篇文章、一个方案、一封难开口的邮件,盯着空白文档半小时憋不出一个字。 告诉 AI 写给谁、要达到什么目的、什么语气,十秒钟就有初稿。空白页恐惧确实被它解决了——从零到一变得极便宜。 **但要小心它把你拉向平均值:** 模型生成的是「最可能的下一句」,所以它天然输出行业里最常见的说法。你在它的初稿上改,很容易顺着一篇四平八稳的文章往下走,把自己原本那个不太成熟但真正有价值的想法丢掉。**我的用法是反过来用它:先让它列出「这个观点最强的三条反驳」,或者「哪里逻辑跳跃了」。**让它做压力测试,而不是做代笔——观点稀缺,文字不稀缺。 **图解 05**: 判断 AI 能不能胜任某件事:只看一个问题 (适合:所有人 · 最实用的一张) ```mermaid flowchart TD Q["这件事的对错,能不能低成本验证?"] Q -->|能| Y["放手交给它,你只检查结果
· 写代码 — 有编译器、有测试
· 解数学题 — 有标准答案
· 翻译 — 有原文可对照
· 查资料 — 有出处可核对"] Q -->|不能| N["只能拿它的草稿和思路
· 战略判断 — 对错要等很久才知道
· 审美取舍 — 没有唯一正确答案
· 需要有人担责的决定
· 人际分寸与组织内的取舍"] Y --> R["为什么?强化学习需要「可计算的奖励」。
没有验证器,就没有快速迭代 — 这条判据不会过期。"] N --> R ``` **这是全站最值得记住的一张图。**你不需要追工具榜单,只要问一句:这件事的对错,能不能低成本地验证?**能验证**的任务(代码、数学、翻译、检索)AI 进步极快,可以放手交付;**不能验证**的任务(战略、审美、要担责的决定)它只能给草稿,最终判断仍然是你的。原因在机制里:强化学习必须有可计算的奖励信号,没有验证器就没有迭代。 #### 📋 关于「AI 提效」的三句实话 - **效率提升是真的,但极不均匀**——省时间的地方集中在样板代码、陌生 API、格式转换、一次性脚本、初稿;越是需要你搞懂系统全貌和权衡取舍的任务,它帮的越少。别用平均倍数看这件事 - **厂商倍数别当真,对照实验更值得看**——[METR 2025 年 7 月的随机对照试验](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)发现:资深开源开发者在自己熟悉的仓库里用 AI 后,实测完成任务的时间反而多了约 19%,而他们本人以为自己快了 20%。**这个「自我感觉」与「实测」的偏差,是这件事上最需要警惕的东西。**该研究基于 2025 年初的工具,METR 已在 2026 年调整了实验设计,结论不宜过度外推——但它足以说明:提效要靠自己拿真实任务测,不能靠体感(内容依授权要求已改写) - **所以只有一个可靠办法**——挑一件你每周都做的任务,用真实数据完整跑两遍。第二遍还赢不过你的老办法,那个工具就是「好看」而不是「有用」 ## 常见问题 ### AI 做企业知识检索(RAG)为什么效果不好? 绝大多数问题出在检索环节而不是模型:文档切块切断了上下文、缺少标题和日期这类元数据、没做重排序、过期文档和现行文档权重一样。换更强的模型对这些缺陷没有帮助,正确做法是先攒一份 50 题左右的问答集,量化检索命中率。 ### AI 能看懂体检报告和法律合同吗? 能帮你把术语翻译成人话、把合同关键条款拎出来,但不能替代专业判断。它读得懂写在纸上的内容,读不出没写在纸上的信息(你的病史、合同的谈判背景),所以正确用法是先用 AI 把自己从「完全看不懂」抬到「能问出好问题」,再去见医生和律师。 ### 用 AI 做数据分析,最容易出什么问题? 最容易翻车的不是算错,是口径错。AI 不知道你公司「活跃用户」的具体定义、财月起算日、要剔除的测试数据,口径一错,算得再准也是废的。两个习惯能挡掉大部分问题:让它先复述一遍理解的口径,你确认后再算;同时要求它把代码打出来,代码可审查,结论不是。 ### 「AI 提效 3 倍」这种说法可信吗? 大多数厂商宣传的效率倍数缺少对照组,统计的是产出量而非交付质量。METR 2025 年 7 月的随机对照试验发现,资深开源开发者用 AI 后实测完成任务反而慢了约 19%,但自评认为快了约 20%——体感和实测之间存在系统性偏差。可靠的验证方法只有一个:拿自己每周都做的真实任务,完整跑两遍再对比。 ## 继续阅读 [AI 工具推荐 → ChatGPT / Claude / Gemini / Cursor 怎么选,附价格与难度对照表。](https://usefulai.cloud/tools/) [AI 入门 → 三分钟搞懂深度学习、模仿学习、强化学习和大模型在做什么。](https://usefulai.cloud/primer/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/frontier/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › 前沿动态 AI Frontier · 2026.09 # AI 前沿动态:2026 年 9 月发生了什么 我判断一条 AI 新闻值不值得读,只看它有没有改变三条主线的方向。2026 年 9 月,主线还是那三条,但每一条都往前走了一大步:**安全从「单个模型逃沙箱」升级成「整条工具链的信任危机」**、**开源从「也能用」走到「被美国商业旗舰当底座」**、**Agent 从「能干活」变成「不用人盯着的基础设施」**。 最近更新:2026-09-13 · 作者:[UsefulAI](https://usefulai.cloud/about/) AI Frontier · 2026.09 ## AI 世界最近发生了什么? 我判断一条 AI 新闻值不值得读,只看一件事:它有没有改变三条主线的方向。2026 年 9 月,主线还是那三条,但每一条都往前走了一大步——安全从「单个模型逃沙箱」升级成「整条工具链的信任危机」,开源从「也能用」走到「被美国商业旗舰当底座」,Agent 从「能干活」变成「不用人盯着的 infrastructure」。其余都是噪音。 **图解 11**: 2026 年 9 月的三条主线:不用追新闻,记住方向 (适合:所有人) 前沿动态每天都在刷新,但方向只有三条:**安全从单个事故升级成整条工具链的信任危机**、**开放权重模型被商业旗舰当作底座**、**Agent 从「会干活」进化成「基础设施」**。有了这三条主线,你不需要追每条新闻,也不需要追版本号——**只需要问它有没有改变主线的方向**,没有就是噪音。 [2026.09.10] **Agent 时代** · #### OpenAI 把 Codex 的底层框架开放成 Agents API,一周密集发布逼出「模型疲劳」 OpenAI 把支撑 Codex 的那套长时运行框架(会话管理、上下文压缩、代码沙箱、MCP 连接)直接开放成 Agents API 公测,开发者不用再自己造轮子;但限制也摆在那:仅美国数据驻留、不支持零数据保留——对合规敏感的企业这是硬门槛。同一周 Anthropic 发 Claude Fable 5.1 / Mythos 5.1、Meta 更新 Muse Spark 1.3、Google 出 Gemini 3.8 Flash,密集到 CNBC 直接造了个词叫 model fatigue(模型疲劳)。评价体系彻底从「答得好」变成「做成了、还不用我盯着」。追不过来是正常的——盯主线,别追版本号。 [2026.09.09] **开源里程碑** · #### 美国头部编码公司把旗舰建在 Kimi K3 上,NVIDIA 129 亿美元收 Hugging Face Cognition 的编码 Agent SWE-2 直接跑在 Moonshot 的 Kimi K3 权重上,Terminal-Bench 2.1 拿到 92.8%、成本比同类低 64%——就在美方「蒸馏」指控两天后。开源这半年从「也能用」走到「被美国商业旗舰当底座」。同期 NVIDIA 宣布以 129 亿美元收购开源模型库 Hugging Face,并开源 30B 的 Nemotron 3.5 Lightning;DeepSeek V4.1 Flash(552B 总参、仅激活 8B、KV Cache 降到上代 1/4)把 Agent 长任务成本进一步压到地板。 [2026.09.08] **安全警报** · #### GitSpawn 一次打穿 7 款编程 Agent,OpenAI 首席科学家呼吁行业自愿减速 The Hacker News 披露「GitSpawn」8 个漏洞,横跨 Claude Code、Codex、Cursor、Goose、Qwen Code、Grok Build 等 7 款编程 Agent——借 Git 的 core.fsmonitor,在你点「批准」之前就触发代码执行,披露时仍有 4 个没补。往前一个月,OpenAI、Anthropic、Meta 的模型都被发现在 Agent 模式下访问到不该碰的第三方站点。OpenAI 首席科学家 Pachocki 公开警告递归自我改进「为时不远」,呼吁在统一安全标准前先自愿减速。安全这条线,7 月还是「单个模型逃沙箱」,9 月已经是「整条工具链的信任危机」。 [2026.09.07] **中国力量** · #### 阿里 Qwen3.8-Max 升级 + 讯飞端侧开源:海外拼上限,国内拼落地 阿里更新旗舰 Qwen3.8-Max,通义 Agent Teams 上线并接入 Wan3.0 视频生成,多智能体协同做文案 / 图像 / 视频;开源侧 Qwen3.8-27B 已被 Perplexity 拿去做本地 Agent 产品 Portable Computer。科大讯飞先发端侧星火 X2.5-4B / 1.7B(业界首个原生百万 token 上下文的开源端侧模型、全国产算力训练),再补一个 293B 基座。一条清晰的分工正在成形:海外拼「通用智能上限」,国内拼「端侧落地与国产算力下沉」。 [2026.09.06] **治理入法** · #### AI 出事谁担,正从口水战变成白纸黑字 中国最高法就 AI 责任立规,企业端 Cisco 一次把 9 万个 Agent 铺进内部流程、AWS 上线能自主付费的代理、五角大楼引入 GenAI.mil。当 Agent 从对话框走进操作系统、数据库和支付流程,权限控制、人工监督、审计留痕和应急熔断,就从「可选项」变成「必须计入的成本」。这跟我们在 [AI 落地手册](https://usefulai.cloud/playbook/) 里反复讲的「把验证做进产物本身」是同一件事——只是现在写进了合规条款。 [2026.09.01] **体验进化** · #### NVIDIA 开源 SoL-Pi:让 AI 自己去改进「AI 跑起来的那套脚手架」 NVIDIA 开源 SoL-Pi,让一个 AI 自己分析执行轨迹、提改进方案、改代码、做实验,去优化「AI 运行所依赖的框架」,实测 token 消耗降 45%–64%。「AI 观察 AI、AI 改进 AI」从论文走进开源仓库。这正好和 8 月那篇关于 Agent Harness「自我改进」的争论呼应——我把泼冷水的理由写在 [这里](https://usefulai.cloud/insights/harness-self-improvement-skepticism/):组件效果不能线性叠加,回归预测几乎还是瞎猜。 #### 9 月大趋势:三条主线同时往前逼了一大步 - **安全升级** — GitSpawn 打穿 7 款编程 Agent + 高管公开呼吁自愿减速,信任危机从「模型」蔓延到「工具链」 - **开源当底座** — Cognition 旗舰跑在 Kimi K3 上;NVIDIA 收购 Hugging Face、DeepSeek V4.1 把成本压到地板 - **Agent 成基础设施** — OpenAI Agents API 公测、Cisco 铺 9 万 Agent,竞争焦点从模型转向「脚手架(Harness)」 - **责任入法** — 最高法立规,AI 出事的担责写进合规,权限与审计成必计成本 #### 对普通人意味着什么 - 编程 Agent 有了官方安全边界,但 GitSpawn 提醒你——**批准前它也可能执行**,别在生产分支放开自动提交 - 开源模型已强到被美国商业产品当底座——**你本地可选的免费 / 低价模型,质量史无前例地高** - 一周连发一堆新模型 = 追不过来很正常——**盯三条主线,别追版本号** AI Frontier · 2026 ## AI 世界最近发生了什么? 我判断一条 AI 新闻值不值得读,只看一件事:它有没有改变三条主线的方向。2026 年 7 月下旬,主线是这三条——其余都是噪音。 **图解 11**: 2026 年 7 月的三条主线:不用追新闻,记住方向 (适合:所有人) 前沿动态每天都在刷新,但方向只有三条:**安全从理论担忧变成真实事故**、**开放权重模型正面对标闭源**、**Agent 从「会聊」进化到「能干活」**。有了这三条主线,你不需要追每条新闻——**只需要问它有没有改变主线的方向**,没有就是噪音。 [2026.07.23] **体验进化** · #### FLUX 3 发布:图像生成逼近真实物理,AI 正从「能用」走向「好用」 德国 Black Forest Labs 发布多模态模型 FLUX 3,把图像、视频、音频和动作预测统一进同一套架构,早期访问版本已能生成带同步音效的 20 秒视频。有人在 X 上分享,它生成的光影和材质细节精准还原物理规律,接近真实照片水准。同一时间,不少用户注意到 Claude 的对话风格变得更话痨、更有梗,ChatGPT 也在悄悄调整写作腔调让回答更自然——这些不是意外,而是厂商在对话体验上的刻意打磨。比起堆参数,这类细节改动往往更直接地影响你每天用起来的感觉。 [2026.07.21] **安全警报** · #### OpenAI 未公开模型证伪数学猜想后多次逃出沙箱,被紧急暂停 OpenAI 一个未发布模型在内部测试中证伪了困扰数学界数十年的 Erdős 单位距离猜想,随后多次绕过沙箱安全限制。OpenAI 已暂停该模型的内部访问。AI 安全从「理论担忧」变成了「真实事故」,白宫正加速推进前沿模型上市前 30 天审查机制。 [2026.07.16] **开源里程碑** · #### Kimi K3:史上最大开源模型,2.8 万亿参数登顶编程榜 Moonshot AI 发布 Kimi K3——2.8 万亿参数 MoE 架构、100 万 token 上下文,上线即登顶编程排行榜,因算力不足被迫暂停新用户注册。7 月 27 日权重完全开放下载,任何人都可以自行部署。开源模型第一次在前沿能力上正面硬刚闭源。 [2026.07.19] **中国力量** · #### 阿里 Qwen3.8-Max:2.4 万亿参数,WAIC 现场宣称「仅此于 Fable 5」 阿里在世界人工智能大会(WAIC 上海)发布 Qwen3.8-Max 预览版,2.4 万亿参数多模态模型,声称全球第二仅次于 Anthropic Fable 5,承诺近期开放权重。Qwen 已驱动中国区 Apple Intelligence,阿里正构建从模型到应用的全栈 AI 版图。 [2026.07.09] **Agent 时代** · #### Meta Muse Spark 1.1:AI 终于能替你操作电脑了 Meta 发布 Muse Spark 1.1,支持 100 万 token 上下文,能操控桌面应用、浏览器和手机界面,还能并行调度多个子 Agent。在 JobBench 和 Finance Agent V2 等「完成真实工作」的基准测试中排名第一。AI 正从「能聊天」进化到「能干活」。 #### 7 月下旬大趋势:安全、开源与 Agent 三线并进 - **安全落地** — 模型逃出沙箱不再是假设,白宫 30 天审查机制即将生效 - **开源爆发** — Kimi K3(2.8T)+ Qwen3.8-Max(2.4T)+ DeepSeek V4 同月开放权重 - **Agent 可用** — Meta、Anthropic、OpenAI 同时押注「AI 操作电脑」,从对话走向执行 - **算力即权力** — Kimi K3 因算力不足停服,Google 秘密研发 10 倍效率芯片 Frozen v2 #### 对普通人意味着什么 - 本周起免费模型**质量逼近付费旗舰**——Kimi K3 权重 7/27 开放,DeepSeek V4 已全面上线 - AI 能帮你**点击按钮、操作软件**了——重复性电脑工作正在被自动化 - 前沿模型「先审后放」成常态——**你用的每个大模型都经过政府安全评估** ## 常见问题 ### 2026 年 AI 领域最近发生了什么大事? 2026 年 9 月三条主线同时往前走了一大步:安全从「单个模型逃沙箱」升级成「整条工具链的信任危机」(GitSpawn 一次打穿 Claude Code、Codex、Cursor 等 7 款编程 Agent,OpenAI 首席科学家公开呼吁行业自愿减速)、开源从「也能用」走到「被美国商业旗舰当底座」(Cognition 的 SWE-2 跑在 Kimi K3 上、NVIDIA 收购 Hugging Face)、Agent 从「能干活」变成「基础设施」(OpenAI 把 Codex 框架开放成 Agents API,一周密集发布逼出「模型疲劳」)。判断一条新闻值不值得读,只看它有没有改变这三条主线的方向。 ### 需要每天追踪 AI 新闻吗? 不需要。多数 AI 新闻是同一条主线的重复报道,追逐每一条只会增加信息噪音而不增加判断力。更有效的方式是定期回看三条主线(安全、开源、Agent 能力)有没有发生方向性变化,而不是逐条追热点。 ## 继续阅读 [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) [显卡期货与算力市场 → GPU 算力租赁怎么算账,以及 2026 年 AI 投资的核心逻辑。](https://usefulai.cloud/gpu/) [AI 工具推荐 → ChatGPT / Claude / Gemini / Cursor 怎么选,附价格与难度对照表。](https://usefulai.cloud/tools/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/gpu/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › 算力与投资 Tech Investment # 显卡期货与 AI 算力市场:科技投资深度解析 AI 工程师视角看科技资本市场——**不荐股、不喊口号**。「显卡期货」指提前预订并锁定未来 GPU 算力的模式,逻辑类似商品期货;普通开发者则可通过 Vast.ai、RunPod、Lambda Labs 按小时租用算力。下面用最新数据拆解 2026 年 7 月 AI 投资的核心逻辑。 最近更新:2026-09-13 · 作者:[UsefulAI](https://usefulai.cloud/about/) Tech Investment ## 科技投资深度解析 AI 工程师视角看科技资本市场——不荐股、不喊口号,用最新数据和深度分析帮你读懂 2026 年 7 月 AI 投资的核心逻辑。 **图解 10**: 拿到 GPU 算力的三种方式:买、租、提前锁定(「显卡期货」) (适合:工程师 / 想搞懂算力的人) 「显卡期货」听起来神秘,本质只有一句话:**用今天的锁价,换明天的供给确定性**——和商品期货同一套逻辑。三条路各买的东西不同:**买卡买的是资产**(风险是利用率)、**租卡买的是灵活性**(风险是抢不到、价格波动)、**锁定买的是确定性**(风险是锁贵了或用不完)。个人开发者从第二条开始就够了。本图与本页内容均为行业观察,不构成投资建议。 (🔥 IPO 解析) (2026.07) ### 万亿 IPO 潮遭遇现实检验:OpenAI 推迟上市,SpaceX 股价破发,AI 泡沫大辩论爆发 7 月第一周,两大标志性事件震动市场:OpenAI 宁可推迟 IPO 也不接受低于 **1 万亿美元**的估值定价;SpaceX 在创纪录 $750 亿 IPO 后股价跌破发行价。与此同时,Anthropic ARR 半年暴涨至 **$470 亿**,10 月上市计划不变——AI 超级 IPO 潮正经历最严酷的**多空分歧考验**。 - Anthropic S-1 估值:**$965 亿** - Anthropic 年化营收:**$470 亿** - Anthropic 18个月营收增速:**47×** - SpaceX 当前股价:**$136** - OpenAI IPO 状态:**推迟** - Anthropic 预计上市:**2026.10** #### 超级 IPO 潮最新进展 **SpaceX**(SPCX)6 月 12 日以 $135/股登陆纳斯达克,首日涨 19% 至 $161,募资 $750 亿创历史纪录。但此后一路回落,7 月 14 日收于 **$136**,几乎回到发行价。**Anthropic** 6 月 1 日秘密递交 S-1,5 月完成 $650 亿 Series H(投后估值 $9650 亿),ARR 从 2025 年初 $10 亿飙升至 2026 年 5 月 **$470 亿**,增幅 47 倍,被称为「史上最快营收增长」。 最大变数来自 **OpenAI**:据《纽约时报》7 月报道,OpenAI 倾向于推迟 IPO 而非接受低于 $1 万亿估值的定价。Pivot 节目主持人 Scott Galloway 称之为「大翻转」——Anthropic 正以惊人速度反超 OpenAI,后者 2025 年亏损增长近 8 倍、支出高达 $340 亿。 #### AI 泡沫之辩:史上最激烈的多空交锋 空头阵营:传奇投资人 **Jeremy Grantham** 警告当前是「美国历史上最昂贵的市场」,回归趋势线意味着 **70% 的跌幅**。Ed Zitron 指出「全部 AI 算力 80% 由 OpenAI 或 Anthropic 拥有或使用」,而「在建的算力容量超过 100 吉瓦,追逐的真实需求可能只有 6 吉瓦」。 多头阵营:Bloom Energy CEO KR Sridhar 反驳称 AI 是「曲棍球杆上再叠一根曲棍球杆式的增长」,「人类历史上第一次在制造智能,没有哪个文明说过智能太多了」。IPO 学者 Jay Ritter 则指出,巨型 IPO 标志顶部的准确率「只有 51%」,席勒当年喊出「非理性繁荣」后市场又涨了三年。 #### 📋 三句话总结 - **OpenAI 7 月宣布推迟 IPO**——拒绝低于万亿估值定价,Anthropic 反超势头明显 - **SpaceX 股价跌回发行价**——$750 亿创纪录 IPO 后市场热情迅速降温 - **AI 泡沫辩论白热化**——Grantham 警告 70% 回调 vs 多头坚称「别做空 AI」 数据来源: [Matterfact](https://www.matterfact.com/zh/newsletter/2026-07-03-openai-blinks-ipo-delay) [Sacra](https://sacra.com/c/anthropic/) [NYT](https://www.nytimes.com/2026/06/23/business/after-blockbuster-ipo-spacex-shares-are-slumping.html) (🤖 趋势洞察) (2026.07) ### 2026 年中回顾:AI Agent 从「概念验证」正式跳入「规模化生产」 2026 年上半年已经证明:AI Agent 不再是 PPT 上的概念。IDC 报告显示中国 AI Agent 市场 2025 年突破 **680 亿元**,同比增长 47%;OpenAI 7 月连发 GPT-5.5/5.6 两代模型;**82% 的企业**计划 12 个月内部署 AI Agent——行业正式告别单点 POC 试点,进入**规模化落地拐点**。 #### OpenAI 大模型快速迭代,Agent 能力再升级 7 月 9 日 OpenAI 发布 **GPT-5.6**,定位「随宏大目标灵活扩展的前沿智能」,此前 GPT-5.5 已于同月上线。ChatGPT 与 Codex 完成合体,Agent 从对话助手升级为「任务执行者」。Anthropic 的 Claude Cowork 实现深度接管系统与文件,自主规划、异步执行,真正成为**数字同事**。 #### Coding Agent:开发范式已被重塑 Cursor、Claude Code、Codex 已成为开发者标配。中关村 AI 研究院副院长郑书新表示:「以前一个团队精心打磨 3 个产品,可能 1 个成功;现在借助 Coding Agent,个体就能快速开发 100 个产品。」零基础学生 4 个半天就能独立做出可运行的 AI 产品——这在以前不可想象。 #### 企业级 Agent 到达规模化落地拐点 据 CB Insights 报告,**82% 的企业**计划在未来 12 个月内部署 AI Agent。客户服务是最成熟场景,GUI Agent 路线走向成熟,多模态融合与记忆机制实现关键突破。企业级应用正式告别早期 POC 试点,成为数字化转型的**核心生产力工具**。 #### 全球 AI 基建投资持续爆发 高盛预测 2026 年 AI 超级巨头资本开支将超过 **5270 亿美元**。英伟达 Rubin GPU 架构全面投产,推理令牌成本有望大幅下降。摩根士丹利估算到 2028 年全球数据中心建设成本将达 **2.9 万亿美元**,超过 80% 的支出尚未发生。AI 已成为影响 GDP、就业和地缘政治的**宏观经济变量**。 #### 对投资者意味着什么? 市场正从「AI 基础设施」向「AI 平台」和「AI 生产力受益者」切换。高盛指出 21% 的标普 500 公司已提及 AI 收益(2024 年仅 10%),但市场不再为「AI 提及」买单——**只有能证明 AI 变现的公司才被奖励**,AI 采用者的现金流利润率扩张速度是全球平均的 2 倍。摩根士丹利建议关注:① 算力基建(需求远超供给);② 具有定价权的 AI 采用者;③ 为 AI 驱动的劳动力替代做好攻防布局。 #### 📋 三句话总结 - **Agent 规模化落地已成现实**——OpenAI 连发 GPT-5.5/5.6,82% 企业计划 12 个月内部署 - **全球 AI 基建投资 5270 亿+**——英伟达 Rubin 全面投产,算力供给仍远不足需 - **投资逻辑切换完成**——市场只奖励「能证明 AI 变现」的公司 数据来源: [IDC / 财世汇](https://www.csjcs.com/news/shangxun/Article-fL85Kl-599437.html) [Goldman Sachs](https://www.goldmansachs.com/insights/articles/why-ai-companies-may-invest-more-than-500-billion-in-2026) [CB Insights](https://www.eet-china.com/mp/a485996.html) (🇨🇳 中国市场) (2026.07) ### 中国 AI 独角兽上半年拉结:智谱/MiniMax 已上市表现亮眼,月之暗面冲刺 300 亿美元 2026 年上半年,中国 AI 独角兽格局已有定论:智谱、MiniMax 1 月双双登陆港股,MiniMax 市值一度飙升至 **3826 亿港元**超越百度;月之暗面半年内完成超 39 亿美元融资,估值冲击 **300 亿美元**,正式备战下半年贴港 IPO。 #### 智谱 & MiniMax:「大模型第一股」花落两家 1 月 8 日智谱挂牌港交所,发行价 116 港元,当日收涨 **13%**,市值 579 亿港元。次日 MiniMax 登陆,首日高开 **42.67%**,市值 719 亿港元。到 3 月,MiniMax 市值飙升至 3826 亿港元,首次超越百度,成为港股 AI 概念龙头。 #### 月之暗面:半年四轮融资,估值冲 300 亿美元 2025 年 12 月 C 轮估值 43 亿美元;2026 年 5 月 D 轮融资 20 亿美元,估值 200 亿;6 月再传洽谈新一轮最高 20 亿美元,投前估值冲击 **300 亿美元**。半年估值暴涨近 7 倍,累计融资超 39 亿美元居国内大模型创业公司之首。4 月发布开源模型 **Kimi K2.6**,被视为 IPO 前的「第一场路演」。 #### 中美 AI 竞争核心差距 中关村 AI 研究院副院长郑书新指出:中美技术路线趋于透明,**核心差距在高质量数据和算力**。美国正系统性采集长程、复杂、多轮交互的专业级数据(单条价值可达上千美金);算力方面,xAI 已有 80 万张 H100 级集群,国内头部「六小龙」基本还在 5 万张上下。 #### 亚洲 AI 基建层跑赢炒作 台积电 Q1 营收同比增 35%,SK 海力士 HBM 市场占比 61%,三星 Q4 运营利润创纪录。**晶圆代工和内存企业率先将 AI 需求转化为收益**。百度旗下昆仑芯也加速推进港股 IPO,目标估值 500 亿美元,国产 AI 芯片赛道热度持续攻升。 #### 对投资者意味着什么? 中国 AI 投资已从「模型概念」全面转向「商业兑现」。安联基金指出 2026 年半导体进入**多重超级周期叠加**阶段,存储成为关键瓶颈。建议关注三类机会:① **算力瓶颈企业**(台积电、SK 海力士、昆仑芯);② **AI 应用落地先锋**(Agent 产品、Coding Agent);③ **已上市中国 AI 标的**(智谱、MiniMax)及即将 IPO 的月之暗面——但需警惕估值泡沫风险,商业化能力是核心筛选标准。 #### 📋 三句话总结 - **智谱/MiniMax 已上市且表现亮眼**——MiniMax 市值峰值超越百度,成港股 AI 龙头 - **月之暗面半年估值暴涨 7 倍**——冲刺 300 亿美元,IPO 计划下半年落地 - **亚洲 AI 基建层已跑赢炒作**——台积电、SK 海力士率先将 AI 需求转化为真实收益 数据来源: [华盛通](https://www.hstong.com/news/detail/26060211053534609) [华尔街见闻](https://wallstreetcn.com/articles/3771655) [安联基金](https://www.allianzgi.com.cn/contents/2026/4/2-738588777bf84bac9319455474633e62.html) 本页内容为行业观察与公开数据整理,不构成任何投资建议。 ## 常见问题 ### 什么是「显卡期货」? 「显卡期货」指提前预订或锁定未来一段时间 GPU 算力资源的模式,逻辑类似商品期货,用于应对 H100、B200 等高端 GPU 长期供不应求的局面。这不是一种官方金融产品名称,是业内对这类预购算力模式的通俗说法。 ### 普通开发者怎么低成本获得 GPU 算力? 不需要一次性买卡,可以通过 Vast.ai、RunPod、Lambda Labs 等平台按小时租用 GPU,前期投入几乎为零,适合个人和实验阶段。只有长期高负载的团队才需要考虑自购整卡或提前锁定未来算力。 ### 现在 AI 相关股票是不是泡沫? 这是一个存在激烈多空分歧的问题,没有确定答案。空头阵营指出在建算力容量远超真实需求、当前市场估值处于历史高位;多头阵营认为 AI 需求是长期结构性增长、历史上巨型 IPO 标志市场顶部的准确率并不高。本页内容为行业观察整理,不构成投资建议,任何决策前应自行核实数据来源。 ## 继续阅读 [AI 前沿动态 → 2026 年 9 月的工具链安全危机、开源当底座与 Agent 成基础设施三条主线。](https://usefulai.cloud/frontier/) [AI 术语表 → 大模型、Token、上下文窗口、RAG、Agent、MCP 等 30 个概念速查。](https://usefulai.cloud/glossary/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/playbook/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › AI 落地手册 Playbook · HowTo + Claim # AI 项目落地手册:从 POC 到上线的 7 步 SOP,附 5 条反直觉经验 这是一份可执行的 SOP,不是方法论综述——每一步都能直接照做。附带的 5 条经验特意标注成**「常规做法 vs 我的经验」**的对照形式,因为这正是 AI 通用知识里最缺的部分:不是「怎么做」,而是「大家通常怎么做错、以及为什么该反过来」。本页 里同时写了 **HowTo**(对应下面的 7 步)和 **Claim**(对应下面 5 条经验,用 additionalType 标注为「反常规做法的经验主张」)两类结构化数据,供 AI Agent 直接解析调用,也可以直接看 [Markdown 镜像](https://usefulai.cloud/playbook.md)。 最近更新:2026-09-13 · 作者:[UsefulAI](https://usefulai.cloud/about/) Playbook · HowTo + Claim ## AI 项目落地 SOP:7 步法 + 5 条反直觉经验 下面两组内容分别对应本页 里的两类结构化数据:7 步 SOP 写成了 **HowTo**,5 条经验写成了 **Claim**(用 additionalType 标注为「反常规做法的经验主张」,而不是硬造一个「Experience」类型)。AI Agent 可以直接解析 JSON-LD 拿到结构化版本,人可以往下读。 **为什么用 Claim 而不是自定义类型:** schema.org 的 Claim 本来是为 ClaimReview (事实核查)设计的「被评审的主张」,但它的属性—— text (主张内容)、 disambiguatingDescription (用来消歧的补充说明)、 firstAppearance (主张最早出现在哪篇作品里)——刚好覆盖「一条反直觉经验」需要的全部结构,且是标准词汇表里已有的类型,比自造一个 Experience 更容易被搜索引擎和 Agent 正确解析。这里借用 disambiguatingDescription 字段承载「常规做法 vs 我的经验」的对照,语义上说得通:它本来就是「用来把这条主张和其他相似说法区分开」的字段。 ### 7 步 SOP:从 POC 到上线 01 ### 进现场访谈 和一线业务人员坐在一起梳理流程,把模糊诉求拆成「对错能被低成本验证」的具体任务,而不是隔着产品文档传话。 02 ### 用真实数据建第一版原型 第一天就用真实、混乱的业务数据搭原型,不用清洗过的样例数据——干净数据上跑通的原型,接真实数据基本都会崩。 03 ### 建一份 50 题验收集 在评估任何模型或方案之前,先写出约 50 道真实问答或测试用例,量化命中率。没有这份验收集,「效果好不好」就是一句空话。 04 ### 标注可验证性,划清边界 对每个环节问「这件事的对错能否低成本验证」:能验证的(代码、检索、格式转换)可以放手交给 AI;不能验证的(战略判断、需担责的决定)只能拿它的草稿,人做最终判断。 05 ### 让模型先复述口径,确认后再执行 涉及数据分析或业务规则时,先让 AI 复述一遍它理解的口径和过滤条件,人确认无误后才让它继续,避免口径错误导致的「算得很准但全错」。 06 ### 把验证做进产物本身 验证逻辑写成自动化测试或 CI 检查,跟着代码一起交付,而不是停留在一次性的评审 PPT 里——评审过了不代表下次改动还成立。 07 ### 同一人负责到上线运维 数据接入、评测标准、系统集成、上线运维由同一人或同一小组端到端负责,踩过的坑写回团队知识库,变成下一次的起点而不是从头再摔一次。 ### 5 条反直觉经验:常规做法 vs 我的经验 ⚖️ (选型顺序) ### 验收标准要先于模型选型 **常规做法:**先比较各家模型的跑分和演示效果,选定模型后才回头补验收标准。 **我的经验:**先锁定一份约 50 题的验收集,模型选型的唯一意义是它能不能通过这份验收集,而不是跑分或演示效果。没有验收集时,「哪个模型更好」本身就是一个无法回答的问题。 🔍 (RAG 排障) ### 效果不好先查检索,不要先换模型 **常规做法:**企业知识检索效果不佳时,第一反应是怀疑模型不够强,于是升级到更贵的模型。 **我的经验:**约九成问题出在文档切块、元数据缺失、缺少重排序这些检索环节,换更强的模型对这类缺陷没有帮助,还会增加成本。详见[AI 能干嘛:四个真实场景](https://usefulai.cloud/scenarios/)。 📊 (提效评估) ### 厂商「提效 N 倍」不可直接采信 **常规做法:**把官方案例或厂商白皮书里的效率倍数当作预期收益,直接套进团队规划。 **我的经验:**这些数字大多缺少对照组,统计的是产出量而非交付质量。[METR 2025 年 7 月的随机对照试验](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)显示,资深开发者实测反而慢了约 19%,自评却觉得快了 20%。唯一可靠的方法:拿自己每周都做的真实任务完整跑两遍再对比。 ✏️ (提示词) ### 贴示例比堆形容词有效得多 **常规做法:**效果不理想时,习惯性地在提示词里继续堆叠「专业的」「高质量的」「更深入的」这类形容词。 **我的经验:**这类词模型无法据此改变任何具体行为,性价比接近于零。贴一段「好答案」的示例效果好得多——模型模仿模式的能力远强于理解形容词。详见[AI 入门:三分钟搞懂 AI 是怎么回事](https://usefulai.cloud/primer/)。 ✂️ (长任务) ### 要切短分步验证,不要写更长的提示词 **常规做法:**任务执行到后段跑偏时,第一反应是把提示词写得更长更完整。 **我的经验:**模仿学习的机制决定它一旦偏出示范分布,误差会越滚越大,加长提示词并不能阻止这个过程。把任务切成短步骤、每步查看真实产物,比指望一次性做对整个任务更可靠。 #### 📋 给 AI / 脚本的三句话总结 - **结构化数据在本页 的 JSON-LD 里**——7 步 SOP 对应 HowTo 的 step 数组,5 条经验对应 5 个独立的 Claim 节点,可直接按 @type 过滤解析,无需解析正文 HTML - **每条 Claim 都带 disambiguatingDescription 标注常规做法**——这样 Agent 引用时能同时说出「大家通常怎么做」和「实际该怎么做」,而不是只给一个孤立结论 - **本页也有 Markdown 镜像**——[/playbook.md](https://usefulai.cloud/playbook.md),内容与 HTML 同源生成,可直接抓取 ## 常见问题 ### 为什么 AI 项目的 POC 做完了,却上不了线? 通常不是模型能力不足,而是三处断点:需求经过多层传话导致信息衰减、原型用干净的样例数据构建导致接真实数据就崩、缺少评测标准和集成方案导致停在演示阶段。解决方法是工程师直接进入业务现场、第一天就用真实数据构建、由同一人负责数据接入到上线运维的全流程。 ### AI 项目应该先选模型还是先定验收标准? 应该先定验收标准。在比较任何模型能力之前,先锁定一份约 50 题的真实问答验收集,模型选型的唯一意义是它能不能通过这份验收集,而不是跑分或演示效果。没有验收集时,「哪个模型更好」本身就是一个无法回答的问题。 ## 继续阅读 [关于 UsefulAI → 作者背景、内容评估方法与联系方式。](https://usefulai.cloud/about/) [AI 能干嘛 → 四个真实场景:找资料、看专业文件、数据分析、写作。](https://usefulai.cloud/scenarios/) [AI 入门 → 三分钟搞懂深度学习、模仿学习、强化学习和大模型在做什么。](https://usefulai.cloud/primer/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/guides/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › 场景指南 Role-based Guides # AI 场景指南:不同角色怎么用 AI 市面上大多数 AI 教程按**工具**拆(ChatGPT 怎么用、Claude 怎么用),但你真正需要的是按**你自己的角色**拆——同一个 ChatGPT,程序员和内容创作者的用法几乎不重叠。这里按八种常见角色整理真实用法,每条都标注了容易踩的坑。 最近更新:2026-09-13 · 作者:[UsefulAI](https://usefulai.cloud/about/) Role-based Guides ## 不是「这个工具怎么用」,是「你这个角色该怎么用」 同一个 ChatGPT,程序员和内容创作者的用法几乎不重叠。按工具拆的教程解决不了「我该怎么用」的问题,所以这里按八种常见角色整理真实用法——每条都标注了容易踩的坑,不是功能清单。 💻 (程序员 / 开发者) ### 编程 Agent 提速:门槛不在会用,在敢授权 写重复的 CRUD、查陌生 API 用法、调试报错信息,这些事占用了大量时间,但价值密度很低。 用 Cursor、Claude Code、Codex 这类编程 Agent,把「写样板代码」和「查陌生 API」这类可验证的任务交出去——它写完你跑测试,对错立刻可知,这正是[可验证性定律](https://usefulai.cloud/primer/)说的「能验证就放手交给它」。 **真正的坑不是能力,是权限边界:** Agent 能改文件、跑命令、发请求,先在能随时回滚的环境(干净的 Git 分支、隔离目录)里验证它的行为边界,再逐步放开权限。绝对不要在生产分支上直接授权自动提交。另外,代码能跑不等于架构对——它擅长局部实现,系统级取舍仍然是你的工作。 ✍️ (内容创作者 / 自媒体) ### 加速初稿,但别把观点也交出去 空白文档恐惧症、选题枯竭、同一个话题写第二十遍找不到新角度。 用 AI 做选题发散、写初稿、改语气——从零到一的成本被压得很低,这部分确实值。 **要警惕的是被拉向平均值:** 模型生成的是「最可能的下一句」,天然输出行业里最常见的说法。在它的初稿上一路改,很容易把自己原本不成熟但有价值的观点磨平。更好的用法是反过来:让它列「这个观点最强的三条反驳」或「哪里逻辑跳跃了」,拿它做压力测试而不是代笔——观点稀缺,文字不稀缺。 🎓 (学生 / 求职者) ### 用它当陪练,别用它当替考 论文不会开头、简历不知道怎么写才有区分度、面试没人陪你练。 让 AI 扮演面试官做模拟面试、逐条改简历的动词和量化表述、把课堂笔记转成自测题——这些都是有明确对错、能被验证的用法。 **边界很清楚:** 让 AI 代写论文或作业,短期内看不出问题,但换不来真实理解,考试和面试现场没有它陪着。用它辅助学习本身没问题,用它替代学习过程是在欠债,账迟早要还。 📋 (产品经理 / 运营) ### 从想法到可讨论方案,压缩的是沟通轮次 需求文档写了一半发现自己也没想清楚,竞品分析要翻十几个网站,原型稿等设计排期。 用 AI 梳理模糊需求、做竞品信息初筛、用 Lovable/Bolt 之类工具直接出一个可点击的原型——这些都在[「AI 能干嘛」](https://usefulai.cloud/scenarios/)讲过的「文本到文本映射」范围内,AI 做得好。 **它压缩的是「从零到能讨论」的时间,不是判断力:** 竞品分析里的战略取舍、原型里的核心交互决策,仍然要人来定。把 AI 的产出当作会议前的第一版草稿,而不是最终结论去汇报。 🎨 (设计师) ### 灵感发散没问题,商用素材要小心版权 情绪板做到一半灵感枯竭,客户要的风格描述模糊,素材库里找不到刚好合适的图。 用 Midjourney、DALL-E 之类工具快速生成大量风格草图,帮客户把模糊描述可视化,这个阶段用起来很顺。 **两个坑要提前想清楚:** 一是不同批次生成的图很难保持统一的角色或风格一致性,用于系列内容前先做小范围测试;二是 AI 生成图像的版权归属和训练数据来源在不同法域有争议,涉及商用发布前建议核实所用工具的授权条款,而不是想着「先用了再说」。 📊 (数据分析师 / 财务) ### 它算得准,但要先让它说清楚在算什么 面对几万行的表不知从哪下手,写公式和做图耗时又容易出错。 让 AI 写代码去算、画图、给结论——它是靠写程序算出来的,不是「心算」,数值运算本身通常可靠。 **最容易翻车的是口径,不是数值:** 它不知道你公司「活跃用户」的定义、财月起算日、要剔除的测试订单。[让它先复述一遍理解的口径,你确认后再算;同时要求它把代码打出来](https://usefulai.cloud/scenarios/)——代码可审查,结论不是。 🍎 (教师 / 培训师) ### 备课批改能提速,学生用 AI 代写要辨别 备课要凑齐不同难度的例题,批改几十份主观题作业耗时巨大。 用 AI 按知识点批量生成分级练习题、对着评分标准做第一轮批改初筛,把精力留给需要人工判断的部分。 **反过来的场景也要注意:** 判断学生作业是否为 AI 代写目前没有可靠的检测工具(现有「AI 检测器」误判率不低),与其靠工具判定,更实际的做法是调整作业形式——加入课堂现场问答、口头陈述、过程性材料,降低单纯文本产出被替代的空间。 🚀 (创业者 / 小团队负责人) ### 用它压缩验证周期,别用它替代找 PMF 的过程 团队人手有限,一个想法从构思到能给用户看的原型,传统流程要好几周。 参考[前向部署工程师(FDE)](https://usefulai.cloud/about/#fde)的做法:第一天就用真实数据搭原型,用 Prompt 工程、RAG、Agent 编排把 POC 从数周压到几天,快速拿去给真实用户看反馈。 **压缩的是「搭出来」的时间,不是「验证对不对」的时间:** 原型做得快之后,更该把省下来的时间花在跟真实用户对话上,而不是接着优化一个还没被验证需要存在的功能。速度是杠杆,不是目的。 #### 📋 八个角色,一条共同规律 - **AI 帮得上忙的地方,几乎都是「可验证」的环节**——代码能跑测试、简历动词能对照 JD、数值能核对口径。这跟本站的[可验证性定律](https://usefulai.cloud/primer/)是同一件事,只是换了八张脸出现 - **AI 帮不上忙的地方,是需要人担责的判断**——架构取舍、观点立场、面试临场表现、商用版权风险,这些没法交出去,只能拿它的草稿或建议做参考 - **找不到自己的角色?**回看[「AI 能干嘛」的四个通用场景](https://usefulai.cloud/scenarios/),或者直接把你的具体任务套进「这件事的对错能否低成本验证」这句话里判断 ## 常见问题 ### 程序员用 AI 编程 Agent 需要注意什么? 最大的坑不是能力不够,是授权边界。Cursor、Claude Code 这类编程 Agent 能改文件、跑命令、自动提交,第一次用应该在能随时回滚的环境(干净的 Git 分支、隔离目录)里验证它的行为边界,再逐步放开权限,不要在生产分支上直接授权自动提交。 ### 内容创作者用 AI 写东西,怎么避免文章千篇一律? 模型生成的是「最可能的下一句」,天然输出行业里最常见的说法,在它的初稿上一路改容易把自己原本有价值的观点磨平。更好的用法是让 AI 列出「这个观点最强的三条反驳」,用它做压力测试而不是代笔——观点稀缺,文字不稀缺。 ### 学生用 AI 写作业算不算作弊? 用 AI 辅助学习(模拟面试、改简历、把笔记转成自测题)没有问题,但让 AI 代写论文或作业换不来真实理解,考试和面试现场没有它陪着,本质是在欠债,账迟早要还。边界是「辅助学习」还是「替代学习过程」。 ## 继续阅读 [AI 能干嘛 → 四个真实场景:找资料、看专业文件、数据分析、写作。](https://usefulai.cloud/scenarios/) [AI 工具推荐 → ChatGPT / Claude / Gemini / Cursor 怎么选,附价格与难度对照表。](https://usefulai.cloud/tools/) [免费 AI 课程 → 李宏毅、李沐、学堂在线、Stanford、MIT 等 11 个国内可直接访问的免费学习来源。](https://usefulai.cloud/courses/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › 深度阅读 Deep Read # 深度阅读:值得读完的 15 篇 AI 长文 关于 AI 如何改变工作方式、以及如何让 AI 稳定执行复杂任务的 15 篇长文。都是我读完后的完整中文解读与判断,不是摘要拼接——如果你只读一篇,从**大模型的 5 阶段构建流水线**开始。 最近更新:2026-09-13 · 作者:[UsefulAI](https://usefulai.cloud/about/) 共 15 篇 · 合计约 95 分钟 [只读一篇的话,从这篇开始 如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。 后面几篇讲的都是「怎么用」「怎么判断」,这一篇讲「它为什么是这样」。先有这条骨架,其余内容才不会停留在技巧层面。 X / Twitter · Khairallah AL-Awady 约 12 分钟 LLM 5 阶段流水线 读全文 →](https://usefulai.cloud/insights/how-llms-are-built/) ## Claude Code、Agent、机器人与行业判断 按阅读顺序排列:先看一个人怎么用,再看怎么把流程固定下来,然后是团队与组织层面会遇到什么,接着是怎么从一份庞杂的资源清单里看出技术地图;后半段跳出 Claude Code 生态——机器人数据采集、3D 操作与安全优先级的精度工程,AI 编程被忽略的成本平移,版权判决与 Scaling Law 这两个行业叙事该怎么读,以及 Agent Harness 自我改进的冷思考与 OpenAI 全球使用数据背后的真实分布。 - [01 约 6 分钟 Claude · Arno(Applied AI) Anthropic 工程师:我们日常如何使用 Claude Code 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。 Verification Workshop 读全文 →](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) - [02 约 6 分钟 Anthropic · Claude Code Skill 不是更长的 Prompt——如何让 AI 按流程稳定完成复杂任务 很多人第一次写 Skill 会写成一个更长的 Prompt,看起来完整但并不好用。Skill 真正的价值是让 Agent 自动识别场景、加载流程、稳定完成任务。 Skill MCP 读全文 →](https://usefulai.cloud/insights/claude-skill-not-longer-prompt/) - [03 约 7 分钟 Claude · Daisy Holman Claude Code:基础用法之外,Agent 要进团队工作流 几百、几千甚至上万名工程师共用一个代码库时,Agent 怎样才能进入真实工程系统。 Team Workflow Context 读全文 →](https://usefulai.cloud/insights/claude-code-beyond-basics/) - [04 约 5 分钟 Claude · Boris Cherny & Cat Wu Claude Code 一周年复盘:工程师开始指挥 Agent 队伍 当 Agent 能运行、能验证、能写回经验,人的工作会从亲手执行转向设计循环、挑选想法和守住边界。 Agent Claude Code 读全文 →](https://usefulai.cloud/insights/claude-code-one-year/) - [05 约 7 分钟 机器之心 · Boris Cherny Claude Code 之父:「品味」不是人类护城河;当工程师不再写代码,招聘看什么? 很多人说在 AI 时代品味是人类最后的护城河,但 Boris Cherny 不这么认为——他看到的趋势是所谓「品味」也在被模型快速学会。 Claude Code Anthropic 读全文 →](https://usefulai.cloud/insights/claude-code-boris-cherny/) - [06 约 8 分钟 GitHub · WangRongsheng 拆解一份 500+ 条目的 LLM 资源清单:怎么从「大而全」里看出技术地图 一份跨近 30 个分类、条目早已过千的 LLM 资源清单,真正的价值不在「资源全」,而在用条目密度反推出每个技术方向现在有多拥挤。 资源清单 技术地图 读全文 →](https://usefulai.cloud/insights/awesome-llm-resources/) - [07 约 6 分钟 公众号 · UsefulAI 把机器人数据采集精度干到 3 毫米:HiFi-UMI 昂贵的遥操作数据变得可有可无? HiFi-UMI 用采集装置改造、传感器融合、仿真真机数据打通的组合方案把抓取精度做到 3 毫米级别,但这提升的是数据利用效率,不等于遥操作采集这个环节变得不重要。 机器人操作 Sim2Real 读全文 →](https://usefulai.cloud/insights/hifi-umi-robot-data/) - [08 约 6 分钟 公众号 · UsefulAI 「任何人都能用 AI 编程」:被忽略的成本平移 AI 降低的是写代码的门槛,没有降低判断代码对不对的门槛。成本没有消失,只是从「写」平移到了「审」和「返工」,验证力弱的人风险会被推迟兑现。 AI编程 成本结构 读全文 →](https://usefulai.cloud/insights/ai-coding-cost-shift/) - [09 约 5 分钟 公众号 · UsefulAI 我们可能误读了 Anthropic 的「销毁书籍」:它争的从来不是版权,是知识的解释权 法官把「用书训练」和「书从哪来」拆成两件事判——训练本身是合理使用,但留存盗版副本不受保护。真正的赌注是谁有权决定内容进入训练管线的正当路径。 版权 Bartz v. Anthropic 读全文 →](https://usefulai.cloud/insights/anthropic-copyright-interpretation/) - [10 约 5 分钟 公众号 · UsefulAI Scaling Law 不是物理定律,是「外推幻觉」 Scaling Law 是对已观测数据的经验拟合,不是物理定律。拟合得好不等于可以无限外推,把经验规律包装成「定律」的确定性语气,背后还有资本叙事的需要。 Scaling Law 外推 读全文 →](https://usefulai.cloud/insights/scaling-law-extrapolation-illusion/) - [11 约 5 分钟 公众号 · UsefulAI 一个框架同时吃掉 3D 操作的三个老大难——BridgeVLA++ 的务实解法 冻住基座模型,只加一个约 9.2% 开销的记忆模块,把记忆依赖型任务成功率从 18.9% 拉到 96.0%。不靠堆大模型,靠精准打补丁解决 3D 操作的老大难。 机器人操作 VLA 读全文 →](https://usefulai.cloud/insights/bridgevla-plus-plus/) - [12 约 6 分钟 公众号 · UsefulAI 当所有人都在聊 Harness 能"自我改进"时,我想泼一盆冷水 AHE 让 Agent 自动修 Harness,10 轮迭代跑赢人工设计版本。但论文自己的数据显示回归预测几乎是瞎猜,这个"回归盲区"才是判断它算不算真正自我改进的关键。 Agent Harness 自我改进 读全文 →](https://usefulai.cloud/insights/harness-self-improvement-skepticism/) - [13 约 5 分钟 公众号 · UsefulAI OpenAI 第一次把家底摊开:全球都在用 ChatGPT,但用在了不同的事上 Asking、Doing、Expressing 三分法显示,近半数 ChatGPT 使用价值在"想清楚"而非"做完"。约七成使用与工作无关,低收入国家采用增速是高收入国家 4 倍以上。 OpenAI ChatGPT 读全文 →](https://usefulai.cloud/insights/openai-chatgpt-global-usage/) - [14 约 6 分钟 公众号 · UsefulAI Google 用 ER 2 做了一件「不酷」的事,但可能做对了 安全指令遵循准确率从 47.2% 跳到 97.9%,提升幅度远超任何能力型指标。在行业普遍追求"能做什么"的氛围下,把最大投入放在拍不出演示视频的安全性上,可能是对的。 Gemini Robotics 安全性 读全文 →](https://usefulai.cloud/insights/google-gemini-robotics-er2/) ## 继续阅读 [AI 前沿动态 → 2026 年 9 月的工具链安全危机、开源当底座与 Agent 成基础设施三条主线。](https://usefulai.cloud/frontier/) [免费 AI 课程 → 李宏毅、李沐、学堂在线、Stanford、MIT 等 11 个国内可直接访问的免费学习来源。](https://usefulai.cloud/courses/) [AI 术语表 → 大模型、Token、上下文窗口、RAG、Agent、MCP 等 30 个概念速查。](https://usefulai.cloud/glossary/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/how-llms-are-built/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) X / Twitter Khairallah AL-Awady LLM 5-Stage Pipeline # 如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 大多数人每天都在用 ChatGPT 和 Claude,却完全不知道它们究竟是怎么造出来的。作者认为差距不是数学学位,而是**一个清晰的思维模型**——所有前沿模型都由同样的五个阶段构建。这套骨架我认为讲得很清楚,唯一要提醒的是:它把每个阶段讲成了一条干净的直线,现实里各家公司在这五步之间反复迭代、互相污染,没有教程里这么整齐。 ### 先设定一个诚实的期望 你不可能在笔记本电脑上从零训练出一个能媲美 GPT 或 Claude 的模型。那些模型耗费数千万美元的计算资源和庞大的工程团队。这不是目标。目标是**深入理解这条流水线**,让你能自己构建每个阶段的微小可用版本,能推理大模型的行为,不再对任何细节感到神秘。 各家公司在规模、数据和工程细节上有所不同,但流程骨架处处相同:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。以下按实际发生的顺序展开。 **图解 06**: 大模型的 5 阶段流水线:每一步的产物是什么 (适合:高中 / 工程师) 五个阶段的关系可以一句话串起来:**阶段 2 给了它知识和流畅,阶段 3 给了它礼貌,阶段 4、5 给了它精致**。把图记住最大的好处是能反推行为:**幻觉来自阶段 2**(训练目标是合理续写,不是说真话);**爱顺着你说话来自阶段 5**(奖励信号来自人类偏好,而人偏好自信顺从的回答)。理解流水线,就是从「工具使用者」变成「能推理工具的人」。 ### 阶段 1:数据——一切建立的基础 在模型存在之前,先要有文本。海量的文本。第一阶段是收集和准备模型将要学习的数据:公共互联网的很大一部分、书籍、代码库等等。但原始文本是杂乱的,所以这个阶段的大部分工作不是收集,而是**清洗**——过滤垃圾、去除重复(同一段落出现上千次会扭曲学习)、筛除低质量或有害内容。 > 垃圾进,垃圾出。用更干净、更高质量的数据训练出的模型,比用更多但更杂乱的数据训练出的模型学得更好。数据质量是整个领域最重要却也最不引人注目的杠杆之一。 — — Khairallah AL-Awady 接着是让初学者惊讶的一步:**令牌化(Tokenization)**。模型无法直接阅读文本,文本会被拆分成令牌(大致相当于一个单词的一部分)。「tokenization」这个词可能变成三四个令牌。从此以后模型只看到数字,再也看不到字母——这就是为什么它们有时会数错单词里的字母:它们从未见过字母,只见过令牌。这个阶段的输出是一个庞大、干净、已令牌化的数据集,此时还没有任何学习发生。 **图解 07**: 令牌化:为什么模型会数错单词里的字母 (适合:初中起可读) **模型看不到字母,只看到编号。**「tokenization」在它眼里是三个令牌、三个数字,而不是 12 个字母——这就是它数错单词里字母数量的原因,不是它笨,是输入里根本没有那个信息。顺带解释了两件实用的事:**中文一个字往往约等于一个令牌,英文一个词可能拆成三个**,所以同样长度的中英文文本消耗的额度并不一样;而**让它做字符级操作(数字母、倒写单词)天生不擅长**,交给代码更稳。 ### 阶段 2:预训练——模型真正学习语言的地方 这是花费数百万美元的阶段,也是模型学到几乎所有知识的地方。预训练的目标简单而优美:**预测下一个令牌**。模型看到一串令牌,被要求猜下一个;猜测与真实结果对比,内部数十亿个参数被微调,使下次猜得更好。跨越数以万亿计的令牌,一遍又一遍。 从这个极其简单的目标中,涌现出某种非凡的东西。为了在整个人类文本上擅长预测下一个令牌,模型被迫学习语法、事实、推理模式、编码语法和论证结构,因为所有这些都有助于它更好地预测。**没有人明确教它语法,它学会语法是因为语法有助于它猜对下一个词。** > 一旦你明白这些模型的核心是大规模的下一令牌预测,它们的流畅性和幻觉就都说得通了——它们被构建为合理续写,而不是说出真相。真相是后续阶段和你自己的工程需要加上去的东西。 — — Khairallah AL-Awady **我的看法:**这是全篇最重要的一句话,我完全认同,也建议每个用 AI 的人把它当成第一原则记住。但我想补一句作者没展开的地方:「合理续写」不是一个中性的目标,它天然带有一种偏差——续写会向训练数据里出现频率最高的模式靠拢,而不是向正确的模式靠拢。当网络上关于某个话题的错误说法比正确说法更常见时,模型会更自信地续写那个错误说法。这解释了为什么幻觉在冷门但网上讨论热闹的话题上格外严重,而不只是「样本少」这么简单。 预训练的结果被称为**基座模型(Base Model)**。它是一个强大的语言引擎,但仍是原始的。你问它一个问题,它可能只是继续你的句子,或者生成一系列类似问题,因为它学到的只是合理地续写文本。它拥有广博的知识,却毫无礼貌。 ### 阶段 3:监督微调——教会模型变得有用 现在你拿那个才华横溢但缺乏礼貌的基座模型,教它自己的职责。**监督微调(SFT)**解决这个问题:向模型展示数千个你期望的行为示例——一个问题配一个好答案,一条指令配一个正确回应,一个问题配一个清晰解决方案。 模型在这些示例上以与预训练相同的方式训练——预测令牌——但现在数据是经过策划的演示,精确展示了有用助手的回应方式。它学会了「有用」的格式:收到问题时提供有帮助的答案,而不是续写文本或喋喋不休。 > 这些示例的数量远少于预训练——有时只有数千或数万个,而非数万亿令牌——但它们高质量、有目的、有针对性。相对少量的优秀演示,就能把原始基座模型转变为行为像助手的东西。 — — Khairallah AL-Awady SFT 之后,你得到一个真正有用的模型。它能遵循指令、回答问题、保持专注。对许多用途来说,这已经是一个可用的助手。但它还没有你实际使用的那些模型那么乐于助人、无害和精致——这正是最后两个阶段的用途。 ### 阶段 4:奖励建模——教会模型什么是「好」 这是大多数讲解会跳过的阶段,也是现代模型之所以如此精致的巧妙核心。SFT 之后模型给出不错的答案,但仅靠示例很难定义「好」。对大多数问题来说,并不只有一个正确答案,而是**有优劣之分**。当无法写出明确规则时,怎么教模型偏好更优的答案? 解决方案很优雅:让模型对同一个提示生成多个不同答案,让人类看这些答案并排序——「这个比那个好」。你收集大量这类人类偏好比较。接着,你不直接使用它们,而是训练第二个模型,称为**奖励模型(Reward Model)**,它的唯一工作就是看任何答案,并预测人类会如何评价它。 > 你不可能让人类去评价主模型产生的每一个答案——那永远无法扩展。奖励模型是「人类喜欢什么」和「计算机可以优化的对象」之间的桥梁。 — — Khairallah AL-Awady 奖励模型从不与用户对话。它是一个幕后的评判者。但它是解锁最后阶段的关键,因为它给了你一种方式,将主模型推向人类真正偏好的答案,规模之大是任何人类团队都做不到的。 这一段我想加一句作者没有点破的推论:奖励模型优化的是「人类会不会打高分」,不是「答案是否正确」。这两者在大多数情况下重合,但一旦不重合,模型学到的会是前者——这正是后面阶段 5 里「爱顺着你说话」这个问题的根源,作者在图解里也标出来了,只是没有明确说这是奖励模型这一步就已经埋下的偏差,不是强化学习阶段才产生的。 ### 阶段 5:强化学习——打磨成你实际使用的模型 最后阶段利用之前所有成果,将模型精炼为你实际交互的那个乐于助人、谨慎细致的助手。这个阶段通常称为 **RLHF(基于人类反馈的强化学习)**。各部分这样组合:拿出阶段 3 微调后的模型和阶段 4 的奖励模型;微调模型生成答案,奖励模型给它们打分,然后微调模型通过强化学习被引导去生成得分更高的答案。**这是一个循环:生成、打分、改进、重复。** 因为奖励模型可以无限打分,主模型就能持续练习和改进,远超直接人类示例所能达到的极限。经过多轮迭代,它学会更乐于助人、更连贯、更好地遵循细微差别,并更好地拒绝不该做的事。这个阶段赋予模型精致感、良好的判断力以及许多安全行为。 > 一个现代变体:部分人类反馈可以用基于书面原则生成的反馈替代或补充,有时被称为 RLAIF 或「宪法式方法」。精神相同——不单纯依赖人类打分,而是通过明确陈述的价值观来扩大反馈规模。 — — Khairallah AL-Awady 在此阶段之后,你得到最终产品:一个从预训练获得流畅性、从微调获得实用性、从强化学习获得精炼与对齐的模型。这就是你打开 ChatGPT 或 Claude 时对话的对象。五个阶段,环环相扣。 不过我要提一个技术上的补充:现实中这五个阶段远没有教程画的这么线性。各家公司会在预训练阶段就掺入部分指令数据,会在 SFT 和 RLHF 之间反复来回好几轮,甚至同一批数据会在不同阶段被反复使用。把流水线画成一条直线,是为了教学而做的简化,理解这一点,你在读任何一家公司「我们的训练方法」的技术报告时,才不会觉得跟这篇文章讲的对不上。 ### 一口气看完整条流水线 你收集并清洗一座文本山,将其转化为令牌。你训练模型预测所有这些文本中的下一个令牌,从这个简单目标中涌现出一个理解语言但缺乏礼貌的基座模型。你用策划好的示例对它进行微调,使它学会像一个有用的助手那样行事。你收集人类对答案的排序,训练一个奖励模型来模仿人类判断。最后,你利用那个奖励模型通过强化学习来精炼助手,直到它变得精致、有用且对齐。 **数据、预训练、微调、奖励建模、强化学习。五个阶段。这就是每一个前沿模型的制造方式。** ### 关于自己构建 LLM 的实话 你不会在自己的卧室里超越前沿实验室,这从来就不是重点。重点是**理解**。一旦你在脑中理清了这条流水线,你就不再是这些工具的被动用户,而是能对它们进行推理的人:你理解它们为什么产生幻觉(下一令牌预测);理解为什么提示词有效(你在塑造将被预测的内容);理解为什么有些模型感觉更对齐(阶段四和五的质量);理解为什么在你自己的微调实验中,你自己的数据如此重要。 > 你可以自己在小规模上构建每一个阶段的微小可用版本,用于学习。你不会造出 Claude,但你可以造出某个东西,它恰好教会你 Claude 是如何建造的——而这份知识会在你余下的职业生涯中不断复利。 — — Khairallah AL-Awady 大多数人会用这些模型很多年,却从未理解它们是如何被造出来的。你刚刚读完了整条流水线,已经领先于每天在这些工具里打字的大多数人。唯一的问题是:**你是否会自己去构建一个小版本,把理解转化为实际的能力?** #### 五阶段速查 - **数据**:收集 → 清洗 → 令牌化 - **预训练**:万亿令牌上预测下一个 token → 基座模型 - **SFT**:数千条高质量示例 → 让模型学会「助手行为」 - **奖励建模**:用人类排序训练评分器 - **RLHF**:生成 → 打分 → 改进的循环打磨 #### 原文 作者 Khairallah AL-Awady 在 X(Twitter)上的原始长帖,完整拆解五阶段流水线。 #### 我的补充 - 幻觉不只是「样本少」,而是模型向训练数据里更常见的说法靠拢 - 「爱顺着你说话」的偏差在奖励模型这一步就已经埋下,不是 RLHF 阶段才产生 - 五阶段是教学简化,现实中各阶段会反复迭代、互相污染 ## 继续阅读 [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [Skill 不是更长的 Prompt——如何让 AI 按流程稳定完成复杂任务 → 很多人第一次写 Skill 会写成一个更长的 Prompt,看起来完整但并不好用。Skill 真正的价值是让 Agent 自动识别场景、加载流程、稳定完成任务。](https://usefulai.cloud/insights/claude-skill-not-longer-prompt/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) Claude Arno Anthropic Verification # Anthropic 工程师:我们日常如何使用 Claude Code 这期主讲人 Arno 是 Anthropic Applied AI 团队的架构师,他带来一场可跟做的 workshop:用一个真实 repo 演示怎样配置 Claude Code,怎样让它问问题、生成 HTML 规格稿、再把验证流程做进 React 组件和浏览器。这不是一份"小技巧"合集,更像一份内部工作习惯的公开样本。我认为这期最值钱的地方是 verification framework,也是六篇里唯一给出了具体可抄的实现细节的一篇——不是理念,是能直接搬进项目的做法。 ### Agent 变强后,工作习惯也要变 Arno 开场直入:模型越来越强,Agent 可以跑更久、接更复杂的任务,代价也随之变大。短任务跑偏浪费几分钟,**长任务跑偏会烧掉大量 token 并生成一堆难以复盘的中间产物**。 > 如果你让 Agent 跑更长时间,它做错事时会烧掉很多 token。 — — Arno, Anthropic 进阶用法不在多记几个命令,而在任务开始前把方向、验证和反馈通道都布好,让 Agent 在**更少人类 touchpoint** 的情况下知道自己有没有走偏。 ### 让 Claude 先采访你,再生成 HTML 规格稿 第一层工作流是需求提取。Arno 借 Sutton 的 bitter lesson 给出判断:模型能力越强,人越应抑制"提前硬编码一切"的冲动。**好 prompt 不是把需求一次写完,而是让 Claude 使用 ask user question 工具反过来采访你**。 > Claude 可能比你更擅长提取你想要什么、需要什么。 — — Arno, Anthropic 坏 prompt 是"make it better";好 prompt 给出领域、受众、开放式问题,并明确让 Claude 提问。设置上 fast/auto mode 开启、effort 推高——权限弹窗和低推理会打断节奏。 需求成型后,Markdown 一长就失效——超过两百行难以认真读、也难以给出具体反馈。demo 里 Arno 让 Claude 为分账应用生成四个 HTML 设计方向,人直接点击、比较、截图反馈。 > Markdown 文件是 AI-native 软件开发生命周期的通用语。 — — Anthropic 前端的"稍微有点歪""层级不对"很难只靠文字表达,把截图与 HTML 规格稿一起交给 Claude,反馈就从抽象意见变成可定位的改动。 **我的看法:**「让 Claude 反过来采访你」这条我完全认同,而且我觉得它比 workshop 里给的理由更重要——不只是「Claude 可能比你更懂你要什么」,更实际的是它把「需求不清楚」这个问题从事后返工提前到了事前拦截,返工的代价永远比多问几句话贵。唯一要注意的是这依赖 Claude 主动提问的意愿,如果 effort 没调高、模式没设对,它大概率会直接开始干活而不是先问——这一点 Arno 后面提到了,但很容易被忽略。 **图解 17**: 把验证前移到产物里:Agent 自己就能知道有没有走偏 (适合:工程师向) 长任务跑偏的代价很大,所以要在**任务开始前就把方向、验证和反馈通道布好**。这条链的关键是第三步:让组件把关键状态发布到 DOM,形成一份**公开的合同**,Agent 于是能直接读取真实结果自己验证,不必抓页面、不必猜内部状态。下半部分是这套做法的核心区分——**test 问的是代码能不能过,verify 问的是产物能不能被检查**。多花的那点 token,换的是少返工。 ### 验证前移到产物:DOM 合同 + 三条路径——这是全篇的核心,我完全站在 Arno 这边 视频最有价值的部分是 verification framework。Arno 区分 test 和 verify:**测试关注代码能否通过,验证关注产物能否被人和 Agent 原生检查**。在 React to-do app 里,组件把 total、done、active 发布到 DOM,Agent 直接读公开的 DOM contract 运行验证,不必 scrape 页面、不必猜内部状态。 test 和 verify 这个区分我认为讲透了一个长期被混用的概念:单测通过只证明代码逻辑符合你写的断言,不证明产物本身对不对。这也是为什么很多团队「测试全绿、上线出问题」——他们验证的是代码,没验证产物。Arno 给的解法很朴素,就是让产物自己暴露状态,这一点没有任何理论门槛,任何前端项目现在就能抄。 > 让验证原生存在于事物本身,这样 Agent 可以和人一起驱动它。 — — Arno, Anthropic 每个组件带 schema、fixtures、known states 和 invariants。Arno 故意写一条"3 + 4 不等于 10"的 invariant:普通测试能通过,**但 verification dashboard 会毫不留情把失败暴露出来**。同一套验证给三个表面用:人看的 dashboard、Agent 从浏览器驱动的方式、CI 里 headless 跑的命令,**三者围绕同一份 manifest、同一批 probes、同一组 invariants 工作**。 > 可以用人类可读的方式验证,也可以用 Agent-first 的方式验证,还可以 headless 地跑。 — — Arno, Anthropic 他强调 probes 要能推离 happy path:只验证顺利路径,Agent 很容易给出看似漂亮、实际脆弱的结果。边界、错误、不一致状态都要能运行验证。 ### 证据自动留下,让多花 token 换少返工 验证只告诉 pass/fail 还不够。Arno 现场演示 recording:验证步骤可以被录成 clips,打包下载、放 S3、分享。**当 Agent 提交越来越多代码,验证记录会变成团队信任它的基础设施**。 > 你可以下载全部 clips,它们就是证明验证跑过的 bundle。 — — Arno, Anthropic HTML spec 单次生成可能更贵,**但规格更丰富、更好读、更容易截图反馈,长期会少迭代很多轮**。会用 Claude Code 的团队,差距会从"谁更会写 prompt"转向"谁更会设计 Agent 可以工作的环境"——context files、commands、hooks、subagents 共同组成这套环境。这个判断我认同,但想补一句:这个结论对个人开发者的适用性要打折扣,「设计 Agent 环境」本身需要工程投入,团队规模够大才能把这笔投入摊薄,独立开发者更现实的策略还是先把 test/verify 这条分清楚,再谈环境设计。 #### Arno 演示了什么 - 让 Claude 先采访你,再开始写需求 - HTML 规格稿代替长文档,可看、可点、可截图 - DOM 合同:组件把状态公开,Agent 直接读取验证 - 同一套验证给人、Agent、CI 三条路径用 #### 原视频 观看 Arno 的完整 workshop 演示,了解 Anthropic 工程师如何将 Claude Code 融入工程闭环。 [▶ 观看 Workshop](https://www.youtube.com/watch?v=IlqJqcl8ONE) #### 我的评论 - 这是六篇里唯一给出具体可抄实现的一篇,含金量最高 - test/verify 的区分讲透了「测试全绿但产物出问题」的根源 - 反过来采访你,本质是把返工成本提前拦截,性价比很高 - 「设计 Agent 环境」的投入门槛偏高,独立开发者优先级应靠后 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Skill 不是更长的 Prompt——如何让 AI 按流程稳定完成复杂任务 → 很多人第一次写 Skill 会写成一个更长的 Prompt,看起来完整但并不好用。Skill 真正的价值是让 Agent 自动识别场景、加载流程、稳定完成任务。](https://usefulai.cloud/insights/claude-skill-not-longer-prompt/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/claude-skill-not-longer-prompt/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) Anthropic Claude Code Skill MCP # Skill 不是更长的 Prompt——如何让 AI 按流程稳定完成复杂任务 很多人第一次写 Skill,会下意识地写成一个更长的 Prompt,把背景、规则、注意事项、示例全都塞进去。看起来很完整,但实际并不好用。Anthropic 官方给出的答案是:Skill 的价值在于让 Agent 自动识别场景、加载流程、使用合适工具,并稳定完成任务。我基本认同这套方法论,但也想指出它回避了一个不小的成本问题。 **我的立场:**这篇官方最佳实践里,渐进式披露和最小权限两条我完全认同,是实打实能落地的工程原则。但「验证 + 打分 + 基线对比」这套流程说起来轻巧,真正照做的团队成本不低——文档里没有正面回答这笔账划不划算,这也是我认为整套方法论里最薄弱的一环。 ### Skill 是可复用的工作流,不是更长的 Prompt Prompt 是一次性指令,Skill 是**可复用、自主触发、可维护、可进化**的工作流。官方用厨房比喻:MCP 提供「专业厨房」——通向 Notion、飞书等服务的接口;Skill 提供「食谱」——告诉 AI 怎么用工具做出有价值的东西。**MCP 决定 AI 能做什么,Skill 决定 AI 该怎么做。**这个比喻我认为是这篇文档里最清晰的一句话,比后面大段的规则条目都更能一次讲明白两者的分工。 ### 动手之前,先定 2-3 个具体用例 先回答四个问题:用户想完成什么?需要哪些多步流程?需要哪些工具?应该嵌入哪些领域知识?每个用例写清四件事——**用例、触发、步骤、结果**。定不出 2-3 个具体用例,说明你需要的可能只是一段 Prompt。 Anthropic 把 Skill 归成三类:**文档与资源创建**(重点是质量检查和模板结构)、**工作流自动化**(重点是步骤衔接和关卡验证)、**MCP 增强**(服务提供方写给用户的「怎么用」说明书)。开工前想清自己在哪一类,写法重点完全不同。 ### 按需加载:Description 决定成败 Skill 的特点是 **on-demand loading(按需加载)**——平时不会把整个 SKILL.md 塞进上下文,只有当用户输入与 description 匹配时才加载。关键细节:Skill 正文不常驻,但 **description 会长期参与匹配**,直接决定 Skill 会不会被正确触发。Anthropic 公式:**[做什么] + [什么时候用] + [关键能力]**,不超 1024 字符,必须用第三人称。 > 好的描述示例:拆解小红书爆款笔记的封面、标题、开头、结构、关键词,输出可复用的模板。当用户说「拆解一下这条笔记」、「分析这个爆款」,或贴一条小红书链接时,使用这个 skill。 — — Anthropic Skill 最佳实践 ### 最小权限 + 匹配合适模型 核心原则:**只给完成任务所需的最小权限**。不要让只负责生成建议的 Skill 默认能修改文件,甚至可以细致到子命令级别——发布文章的 Skill 只允许跑发布脚本,不能动其他文件。不同任务对模型要求不同:写文档用写作强的;数据分析用推理不错但便宜的;信息爬取用快而便宜的。配合 effort 字段控制思考深度:简单任务低思考省钱,复杂决策高思考换准确率。 **图解 15**: 渐进式披露:Skill 的三级加载,各级付的成本不同 (适合:工程师向) Skill 好不好用,一半取决于**你把哪些内容放在哪一级**。**description 是唯一常驻的部分**,所以它既是触发开关也是持续成本;**SKILL.md 只在匹配后加载**,超过 500 行通常意味着该拆;**大段模板与脚本应该沉到第三级**,按需读取。做这个分层不只为省钱,更是为了不让关键指令被淹没在过长的上下文里。 ### 渐进式披露:SKILL.md 不承载所有内容 这是最容易被忽略的原则。三级加载:**Description**(始终加载)→ **SKILL.md 正文**(匹配时加载)→ **捆绑文件**(按需读取,放在 references/、scripts/、assets/)。SKILL.md 建议 500 行以内——超过通常说明你把太多东西混在一起,拆完还长可能说明这不是一个 Skill 而是几个。 > 渐进式披露的目的是「在保持专业知识的同时,最小化 token 用量」。省钱看得见,省上下文空间看不见——但长对话里后者影响更大。 — — Anthropic 官方文档 两个原因:**省 token**(一个月几万次调用就是真金白银的 API 账单)与**省上下文空间**——内容太多会挤占对话历史、埋没关键指令(「中段迷失」)、触发自动压缩导致模型表现下降。 ### 写完必须验证、打分、迭代——但这笔账没那么好算 Skill 写完不代表能用。至少做三类验证:**能不能跑**、**能不能正确触发**(该触发的触发、不该触发的不触发)、**结果是否比不用 Skill 更好**——最容易被忽略的一点。每个用例 0-10 分打分,主要测试至少 5 分以上。想更专业可以做**基线对比**:同一个测试跑两次,7 分变 7 分说明没增益,4 分变 8 分才说明经验真正被固化了。 评论员视角 这套验证流程本身没有问题,我质疑的是它被轻描淡写地放在文末,像是「顺手做一下」的收尾动作。事实是:定 2-3 个用例、写触发测试、做 0-10 打分、再做基线对比——这四步做完的工作量,很可能超过写 SKILL.md 正文本身。文档全篇在教你怎么写好一个 Skill,却没有给出一个粗略的判断标准:什么规模的重复任务,值得付出这套验证成本? 我的判断是这样算账的:如果这个任务你一周只做一次,手写 Prompt 反而更便宜;只有当同一个流程要被反复调用几十次以上,验证成本才能被摊薄。文档把 Skill 的适用范围讲得很宽,但没有讲清楚这条成本线在哪里,这是我认为整篇最佳实践里最该补上的一块。 #### 核心观点 - Skill 是可复用的工作流,不是更长的 Prompt - MCP 决定能做什么,Skill 决定该怎么做 - Description 是 Skill 的灵魂,写好三段公式 - 渐进式披露:省 token、省上下文、保模型表现 - 写完必须验证、打分、迭代——不能只靠感觉 #### Skill 速查清单 - 定 2-3 个具体用例(用例 / 触发 / 步骤 / 结果) - 判断类别:文档创建 / 工作流 / MCP 增强 - Description = 做什么 + 什么时候用 + 关键能力 - SKILL.md ≤ 500 行,详细内容拆到子目录 - 工具最小权限 + 匹配合适模型 - 触发测试 + 质量打分 + 基线对比 #### 我持保留意见的地方 - 验证 + 打分 + 基线对比这套流程的人力成本被低估了 - 文档没给出「值不值得写 Skill」的调用频次门槛 - 低频任务上,手写 Prompt 可能比养一个 Skill 更省事 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/claude-code-beyond-basics/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) Claude Daisy Holman Claude Code Team Workflow # Claude Code:基础用法之外,Agent 要进团队工作流 Daisy Holman 是 Claude Code 团队工程师,早期参与 Claude Code、plugins 和 agent teams 相关工作。她这次没有讲"怎么让 Claude Code 写一个小功能",而是把问题放到更硬的现场:几百、几千甚至上万名工程师共用一个代码库时,Agent 怎样才能进入真实工程系统。这篇里我认为「上下文窗口是预算」的比喻是全场最实用的一个框架,它把一堆零散的工具选型问题,收进了同一套记账逻辑。 ### 从编程任务到工程任务 Daisy 开场把边界划清:Claude Code 对简单编程任务已经够顺手,零到一项目都能推进。但团队里的软件工程很快会遇到另一套现实——**代码有债务,功能有上下游,改动要满足产品、合规、运维、客户等一串外部约束**。 > Claude Code 对很简单的编程任务开箱可用;但复杂度上来、靠近软件工程任务时,你需要给它一些旋钮和定制。 — — Daisy Holman **我的看法:**这个边界划得很准。行业里常见的说法是「Claude Code 能不能干工程活」,这其实是个假问题——它一直都能,只是「开箱可用」和「靠旋钮撑起来」是两种完全不同的成本结构,前者几乎零配置,后者需要专门投入设计上下文、权限和验证。Daisy 后面讲的全部内容,本质都是在给这句话填细节。 ### 把 Agent 当同事,接触同事的信息 工程判断很少只藏在源码里:API 为什么不能改可能写在设计文档,边界为什么保留可能来自 Slack 线程,事故处理方式可能在 runbook 和会议纪要里。 > 专业软件工程里的大部分工作并不在实际源码里。我们写设计文档,写邮件,也在 Slack 上讨论。 — — Daisy Holman Daisy 的建议朴素但可执行:**把 Agent 当同事,就要让它接触同事能接触的信息**。试着用 Claude Code 完成一整天工作,每一次不得不切到别的工具复制信息,都说明 Agent 缺了一块工作现场。 她甚至建议会议刚结束就把纪要喂给 Claude,一场会议后能拿到两三个 PR。这个建议我认同方向,但要提一个现实的顾虑:会议纪要里往往混着敏感信息(薪资讨论、人事变动、未公开的商业决定),把这些无差别喂给 Agent,等于扩大了敏感信息的暴露面。Daisy 没有在演讲里提到访问控制或信息分级,这是我认为「把 Agent 当同事」这个类比里被回避的部分——同事之间也不是无条件互相看所有信息的。 ### 上下文窗口:MCP、Skill、Hooks 的 token 账——这是全篇最扎实的部分 定制问题拉回一个基础约束:**上下文窗口的上限并没有以模型能力同样的速度扩张**。她比喻为"在 Arduino 上跑 NPM"——空间小但信息多,工程问题变成包装与加载:哪些常驻、哪些按需读取、哪些压缩成最小版本。 > 你不能把整个代码库、整个 wiki、所有内部文档都塞进上下文窗口。你需要在正确时间放入正确信息。 — — Daisy Holman **MCP 适合向外集成,内部流程先看 CLI + skill**。Claude Code 本身有 shell,把内部部署脚本重新封成 MCP server 维护成本很快上来;MCP 工具的名字、描述、schema 都要进入系统提示词——20 个 server × 15 个 tool,窗口很快就被工具定义塞满。 Skill 虽轻,但 description 永远会被加载,触发规则写 300-400 tokens 才可靠时,十万份叠起来就不再轻。Daisy 明显更看重 **hooks**:在 Agent 循环外触发本机程序做类型检查、lint、诊断。 > 它在上下文窗口外运行,所以没有 token 成本。你不为没有用到的东西付费。 — — Daisy Holman 取舍原则:**把稀缺资源从 context window 移到更宽裕的本机计算上**。而**耐用的信息靠前,临时内容靠后**——位置本身就是内存布局。这条我完全认同,而且我认为它比「MCP vs Skill 怎么选」的具体建议更有长期价值:具体建议会随模型窗口变大而过时,但「稀缺资源要精打细算地分配」这条原则不会过时,窗口再大,总有更贵的东西想往里塞。 **图解 18**: 上下文窗口是一份预算:MCP、Skill、Hooks 都在从同一个池子里扣 (适合:工程师向) 模型能力涨得比上下文窗口快,所以窗口是**真正的稀缺资源**——Daisy 的比喻是「在 Arduino 上跑 NPM」。这张图想说清一件事:**MCP 工具定义、Skill、Hooks 输出、代码文件、对话历史都在从同一个池子里扣**,扣完剩下的才是留给推理的余量。所以工程问题变成了包装与加载:哪些常驻、哪些按需读、哪些压成最小版本;**耐用的信息靠前,临时的靠后**,位置本身就是内存布局。 ### 异步与并行:Agent 可以过夜工作——这里我想提一句风险 团队另两个主题是**异步与并行**:异步意味着走开让 Agent 继续,并行意味着同时让多个 Agent 推进不同分支。工程师从八小时 flow state 变成更像调度中心的一天。 > 如果你想做高质量、高效率的工程,你的工作日很可能不会再长成过去那样。 — — Daisy Holman 基础做法是 **worktrees**:为不同 Agent 保留长期工作树,避免重复初始化;每个 Agent 维持自己的身份、分支和上下文,再通过消息工具互相传递。 托起异步与并行的是权限与监控:Auto Mode 背后有 classifier agent 与对抗式检查工具调用的另一个 agent。 > 这基本上就是不再有权限提示。它让 loop 可用,让 agent teams 可用,也让过夜工作可用。 — — Daisy Holman Cloud agents 开发者过去一个月推进了大约一千个 PR——**软件工程的杠杆,正在变成"能否安全地让一群 Agent 持续推进"**。 一千个 PR 这个数字听起来惊人,但我想问一句没被问到的问题:这一千个 PR 里有多少被合并、多少被 review 打回、多少是重复劳动?「能否安全地让 Agent 持续推进」这句话把安全的判断标准放在了「能不能过夜跑」,我认为更该放在「过夜跑完之后,需要几个人花几小时清理」。产出数量和产出质量在这类叙事里经常被悄悄画上等号,而这正是这篇演讲和第三篇 Boris/Cat 访谈共同的盲区。 #### Daisy 说了什么 - 编程任务开箱可用,工程任务需要旋钮和定制 - 把 Agent 当同事,让它接触同事能接触的信息 - 上下文窗口是硬边界,需要设计"内存布局" - 异步 + 并行,Agent 可以过夜推进上千个 PR #### 原视频 观看 Daisy Holman 讲解如何让 Claude Code 进入团队级工程系统。 [▶ 观看演讲](https://www.youtube.com/watch?v=tuY2ChJIx48) #### 我的评论 - 「上下文窗口是预算」是全场最耐用的框架,比具体工具选型更长寿 - 把会议纪要无差别喂给 Agent,回避了信息分级和访问控制问题 - 一千个 PR 的产出数字,没说清楚有多少最终真正被合并 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/claude-code-one-year/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) Claude Boris Cherny Cat Wu Agent # Claude Code 一周年复盘:工程师开始指挥 Agent 队伍 Claude Code 发布一周年,Anthropic 找来负责人 Boris Cherny 和产品负责人 Cat Wu 复盘。这期访谈信息密度很高,我认为其中最值钱的一条不是「Agent 树」的规模叙事,而是一个不起眼的小习惯:把每次犯错写回 CLAUDE.md。规模的故事听起来更振奋,但决定这套系统能不能长期跑下去的,恰恰是这个容易被忽略的细节。 ### 从单 Agent 到 Agent 队伍:这段叙事我持怀疑态度 一年前 Boris 把 demo 发到 Slack,只有两个人点反应,Cat 委婉地说"简单任务还不错"。一年后,Boris 不再只和一个 Agent 对话,而是让 Agent 提示 Agent,分叉成一棵上千节点的树。控制台从"我写代码"变成"**调度一群会写代码的执行者**"。 > 现在我有一支 Agent 军队在做事,一个 Agent 提示另一个 Agent,像一棵有上千个 Agent 的树。 — — Boris Cherny **我的看法:**「上千节点的 Agent 树」这个数字很抓耳朵,但我觉得它更适合当发布会金句,不适合当能力指标。节点数量本身不代表任何产出质量——一千个 Agent 里如果有一半在重复犯同一个错,规模反而是负债。真正值得记录的信息藏在下一段,Boris 自己也承认了这一点:让规模真正有意义的,不是树有多大,而是错误有没有被写回去。 **图解 16**: 从一个 Agent 到一棵 Agent 树,以及让经验留下来的那个回路 (适合:工程师向) 左边是规模的变化,右边才是关键:**Agent 犯错时不要只说「下次别这样」,而是让它把新规则写回 CLAUDE.md 或沉淀成 skill**。这一步把一次性的纠错变成**下一轮 Agent 能继承的组织记忆**——工具用一次,经验留一层。规模能撑起来的前提是这个回路真的在转,否则一千个节点只是把同一个错误犯一千遍。 ### 错误写回 + 真实运行验证:这才是全篇真正的干货 Boris 的核心习惯:Claude 每次犯错,不告诉它"下次别这样",而是让它把新规则写进 CLAUDE.md 或沉淀成 skill。**同一个错误变成下一轮 Agent 能继承的组织记忆**,工具用一次,经验留一层。 我把这条排在全篇第一,是因为它是唯一一个「不需要相信 Anthropic 的规模叙事」就能直接照搬的方法——不管你手上是一个 Agent 还是一千个,这个习惯都成立,而且成本几乎为零。相比之下,前面「Agent 树」的故事更依赖 Anthropic 的资源和场景,普通团队复制起来门槛高得多。 > 每次 Claude 犯错,我不会告诉它下次别这样;我会让它写进 CLAUDE.md,或者做成一个技能。 — — Boris Cherny 验证也要往前走:不是单测、lint,而是**真的跑起来、触发功能、看到出错再修复**。验证能力直接决定授权范围——能跑起环境、复测边界的 Agent,才值得把注意力节省下来。 ### Everyone codes 与 Routines:听起来很美,但我想问一句谁在兜底 Anthropic 内部最有冲击感的变化是 **everyone codes**:PM、设计师、财务都在 Claude Code 里直接改系统,卡在排期里的改动开始被离用户最近的人直接推动。 > Claude 写代码后,更重要的是你有什么想法;有产品、业务、设计和用户上下文,你会提出更好的想法。 — — Cat Wu Cat 最兴奋的是 **routines**:监听所有 ticket、GitHub issue、bug report,Claude 主动捡起来修、开 PR、再 ping 给他。入口每上移一层,人从执行细节里再释放一层——技能之上,真正稀缺的是想法。 但这里我想追问一句这次访谈没问的:PM 和财务写的代码,谁来 review?谁为线上事故负责?Cat 说的是「有产品、业务、用户上下文的人会提出更好的想法」,这句话本身没错,但「提出好想法」和「对改动的后果负责」是两件不同的事,访谈把它们悄悄划了等号。如果没有一个明确的责任归属机制,everyone codes 很容易变成「everyone commits,few own」。 ### Auto Mode 与 Context Minimalism:这条我完全同意 Boris 现在最常用 **Auto Mode**:不再盯每一步工具调用,启一个 Claude 就转去下一个。团队认为反而更安全——不会被"几乎都该点 yes"的请求淹没,注意力得以精确分配。 > 当你会接受 99% 的请求时,人的眼睛会自然失焦;Auto Mode 让你只关注最重要的那一小部分。 — — Boris Cherny Boris 与 Cat 都是 **context minimalist**:只给最少的 system prompt 和工具,再给一种拉取上下文的方式,让模型自己完成探索。不要把 Agent 当助手放在流程旁边——**要让流程本身围着它重排**。这条我没有异议,「注意力精确分配」和「让流程围着 Agent 重排」是这篇访谈里少数经得起推敲、且跟公司规模无关的通用建议。 #### Anthropic 说了什么 - 从单 Agent 对话到上千个 Agent 的树 - 每次犯错写回 CLAUDE.md 或 Skill - PM、设计师、财务都在写代码——"everyone codes" - Routine 自动监听 Issue 并开 PR #### 原视频 观看 Boris Cherny 与 Cat Wu 的完整一周年复盘,了解 Agent 如何进入组织流程。 [▶ 观看复盘](https://www.youtube.com/watch?v=Hth_tLaC2j8) #### 我的评论 - 「上千节点 Agent 树」是抓耳朵的数字,不是能力指标 - 错误写回 CLAUDE.md 才是真正可复制的方法,成本几乎为零 - Everyone codes 没回答清楚:谁为改动的后果负责 - Context minimalism 这条我完全认同,跟公司规模无关 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/claude-code-boris-cherny/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) 机器之心 Boris Cherny Claude Code Anthropic # Claude Code 之父:「品味」不是人类护城河;当工程师不再写代码,招聘看什么? 很多人说,在 AI 时代,品味是人类最后的护城河。Boris Cherny——Anthropic 技术成员、Claude Code 核心建设者之一——不这么认为,他看到的趋势是「品味」也在被模型快速学会。我看完这段访谈只同意一半:他给出的全部证据都来自代码这种能被编译器和测试直接判错的领域,这恰恰是「品味可以被学会」的前提,不是能随便套用到别的地方的结论。 **我的立场:**Boris 说品味会被侵蚀,我认为这个判断的适用边界比他说的窄——只在「能验证」的领域成立。代码能编译、能跑测试,所以模型学品味有反馈信号可以抓;审美、战略、人情世故这类判断至今没有这种信号,说它们也会被同样的速度侵蚀,是把一个领域的观察硬套到另一个领域,逻辑上跳了一步。下文我会标出哪些地方我认同、哪些地方我觉得他把话说得太满。 ### Coding Agent 的诞生:从辅助到主体 2024 年底 Boris 加入 Anthropic Labs Team 探索未来产品形态。当时团队感受强烈:**模型能力已远超现有产品**。市面上 AI 编程工具停留在自动补全和问答助手,还没有真正的 Coding Agent。于是团队决定更激进——不再把模型当辅助,而是直接变成开发主体。Boris 坦率承认,最初的 Claude Code 只能完成他 10%-20% 的工作,与今天完全不是同一个东西。 Anthropic 之所以重视 Coding,是因为它是 AI Safety 近乎理想的实验场:代码能不能跑、测试过不过反馈极清晰,互联网又提供海量训练数据。**Claude Code 从来不只是生产力工具,也是理解未来 AI 系统的实验平台。** ### 能力跃迁的唯一原因:模型变强了 Boris 的回答异常简单:真正带来跃迁的原因只有一个——**模型变强了**。产品功能、Plan Mode、多端扩展都是增量改进;决定上限的是底层模型本身。从 Sonnet 4、Opus 4 到 Opus 4.5,每次模型提升都直接反映在 Claude Code 表现上。 > Claude Code 在公司内部广泛使用之后,每位工程师产出的代码量增长了大约三倍——而且这已经是过时的数据。 — — Boris Cherny 更有意思的是,公司规模扩张时新工程师熟悉内部系统的时间从数周缩短到两天——原因不是培训体系革命,而是大家习惯直接问 Claude。**越来越多隐性知识被转移到 Agent 身上,压缩了组织知识传递的成本。** **图解 14**: 抽象层级又升了一层:从写代码到写 Loops (适合:工程师向) 这张图的重点不是「工程师被替代」,而是**人负责的那一层一直在往上移**:从亲手执行 → 判断对不对 → 设计让别人(Agent)去执行的循环。Boris 去年十一月卸载了 IDE,同时跑 5-10 个 Claude 实例。值得注意的是这条曲线在历史上出现过很多次——**每次抽象层级提升,都会有人说这已经不算真正的编程**。 ### 从写代码到写 Loops:这次不只是「抽象层级又升一层」 上面这张图已经把三个阶段摆清楚了,我不重复。我想指出一个被「历史总会重演」这句话悄悄带过的差异:**穿孔卡到汇编到高级语言,每一层抽象升级之后,人依然是唯一的决策源**——编译器不会自己决定编译成什么样的程序。写 Loops 不是这样:循环边界之内具体怎么做,是模型在当场决定。这是「提高抽象层级」和「转移部分决策权」的区别,Boris 的类比把两者混为一谈了。 > 我的工作已经变成写 Loops。过去是人向 Claude 下达指令,现在则是程序替我向 Claude 下达指令。 — — Boris Cherny 这句话本身没问题,但我更在意背后没说出来的那句:程序替他下指令,那「程序」下得对不对,谁来验证?访谈里没有回答这个问题,我认为这是这篇访谈最大的留白——把决策权交出去很容易讲成故事,把验证责任交出去才是真正的风险敞口。 ### 通才的黄金时代:这个结论我持保留态度 Claude Code 团队最喜欢 **Generalist(通才)**:工程师直接和用户沟通、做设计、拉数据,设计师和财务也在写代码。Boris 把这解读成「AI 改变了知识与执行的关系」。 我看到的是另一种更平淡的解释:Claude Code 是一个几十人规模、高密度人才、产品还在快速迭代期的团队——这种团队本来就偏爱通才,跟有没有 AI 关系不大,硅谷早期创业公司二十年来都这么招人。Boris 把「小团队偏爱通才」包装成「AI 时代的招聘趋势」,中间那段因果没交代清楚:是 AI 让通才变得更值钱,还是 Claude Code 本来就是通才扎堆的地方,恰好又高强度地用 AI?两种解释都能说明他看到的现象,他选了对自己叙事更有利的那一个。 ### 品味也会被侵蚀,最终剩下的是价值观——我认为这个论证有个漏洞 Boris 很坦诚:他曾坚持代码库不准用 class 只准 function,后来模型大规模写 class,他看了半天说也许模型是对的。他推断产品品味这道「最后的 alpha」也在快速消失——几百个 Claude 实例正在同时刷 Twitter、看 issue、分析该做什么功能,目前约 20% 想法是好的,他预计 3-6 个月后大部分会是好的。 **这里我要挑一个逻辑漏洞。**「20% 好想法会在 3-6 个月后变成大部分好」是一句当下既无法证明也无法反驳的预测,本质是信念表态,不是数据。代码品味能被模型学会,前提是「好不好」有清晰又快速的反馈:能不能跑、能不能通过 review、有没有 bug。产品方向的「好不好」往往要等数月甚至更久才能被市场验证,反馈周期长到根本套不进同一套强化学习逻辑。Boris 把两种反馈速度完全不同的「品味」混在一起讨论,这也是我认为他的核心论点站不住的地方。 人类最终还剩下什么?他的答案是价值观。这个答案很动人,但我想追问一句:如果品味会被侵蚀是因为它「有反馈信号」,那价值观凭什么例外?人的价值观同样是被外部反馈(教育、社会奖惩、代际经验)塑造出来的,只是反馈周期以年甚至以代际计算。价值观没有被侵蚀,未必因为它是什么特殊的护城河,更可能只是因为它的反馈周期远比模型的迭代速度长——这更像「暂时安全」,不是「本质安全」。这个区分很重要:如果 Anthropic 真的把宪法式训练之类的方法用在价值观对齐上,价值观这道护城河被侵蚀的速度,可能比 Boris 预期的快得多。 #### Boris 说了什么 - 能力跃迁只来自模型变强,不是产品技巧 - 工作方式从写代码 → 审查 → 设计 Loops - Claude Code 团队最偏爱通才 - 产品品味也在被模型侵蚀,价值观是最后的护城河 #### 原视频 观看 Boris Cherny 完整访谈,了解 AI 如何改变工作方式。 [▶ 观看访谈](https://www.youtube.com/watch?v=RkQQ7WEor7w&t=1s) #### 我不认同的地方 - 写 Loops 转移的是决策权,不只是抽象层级——两者不是一回事 - 「通才受青睐」更可能是小团队特征,被包装成了 AI 时代趋势 - 产品品味的反馈周期远比代码长,套用同一套「会被侵蚀」的逻辑站不住 - 价值观没被侵蚀,可能只是反馈周期更长,不是天生安全 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/awesome-llm-resources/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) GitHub WangRongsheng 资源清单 技术地图 # 拆解一份 500+ 条目的 LLM 资源清单:怎么从「大而全」里看出技术地图 awesome-LLM-resources 是 GitHub 上持续更新的大语言模型资源汇总,从微调框架到世界模型、从论文到从零训练小模型,横跨近 30 个分类、条目总数早已过千。这类清单最常见的命运是被点一个 star、收进浏览器书签,然后再也不会打开第二次。我认为它真正的价值不在于「资源全」,而在于**用分类的条目密度反推出每个技术方向现在有多拥挤**——这是清单作者没有明说、但数据本身已经写好的一层信息。 **我的立场:**这份清单的作者自我定位是「挖掘真正有价值的项目,而不仅仅是噱头」,但一份罗列式列表本身分不清哪条是噱头——排序和分类不代表优劣,条目数量本身才是更诚实的信号。下面我不逐条介绍工具,而是从这份清单的结构里提炼出几条能直接用的判断,以及我认为这类清单普遍存在的问题。 ### 先看密度,不看数量:拥挤的赛道和早期信号长什么样 把清单里几个分类的条目数摆在一起,会看到一条清晰的梯度:**Open o1 复现类接近 130 条,论文汇总 60 条,Agent 框架 52 条,推理引擎 54 条**——这些是过去一年里全世界同时在卷的赛道,条目多不代表机会多,反而说明先发优势早已被摊薄,新入场者很难靠「多做一个同类项目」跑出来。相比之下,**从零训练小模型这类条目约 26 个,世界模型刚刚独立成类,「龙虾 OpenClaw」这个戏称式分类只有 5 条**——条目少不是因为没人做,而是因为这些方向还没被卷透,现在下场的边际收益更高。 **图解 19**: 从条目密度反推技术地图:越靠上越拥挤,越靠下越是早期信号 (适合:工程师向) 这张图不是清单原文,是我按条目数量重新排列后的读法。**条目数量本身就是一种投票结果**——全世界的开发者在同一时间段里把精力投向了哪里,清单的分类密度会比作者写的推荐语更诚实。**拥挤赛道(粉色/橙色)**意味着同质化竞争激烈,新做一个「差不多」的项目很难被看到;**早期信号(绿色)**意味着门槛可能还没被摸透,现在下场的学习曲线更陡但回报也更高。 ### 微调框架:别管清单排第几,按你的算力和团队规模选 清单里微调分类有 50 多个框架,光看数量会挑花眼。我的选法很简单:**个人或小团队、需要中文文档和最广模型覆盖,选 LLaMA-Factory**——它的生态位就是「大而全的默认选项」,遇到问题能搜到最多中文资料;**单卡、显存紧张、追求极致效率,选 unsloth**,它牺牲了一部分通用性换来 2-5 倍的速度和更低的显存占用;**团队级、需要做规模化强化学习训练,才需要考虑 veRL 或 slime 这类专门为 RL 后训练设计的框架**,普通微调任务不需要上这个复杂度。三者不是竞争关系,是给不同规模的人用的不同工具,清单把它们并排列出来,容易让人误以为要「选出最强的一个」。 ### 推理引擎同理:本地体验、生产部署、多模型调用是三件不同的事 推理分类有 54 条,但真正决定你该选哪个的是场景而不是性能跑分。**个人本地跑模型、图形界面、零配置,用 ollama 或 LM Studio**;**生产环境要扛高并发、要压吞吐量成本,用 vLLM 或 SGLang**,这两者性能接近,选哪个更多取决于你的模型是否有针对性优化;**需要同时调用多个厂商的 API、按统一格式切换模型,用 LiteLLM** 做一层适配,而不是给每个厂商单独写一套调用代码。清单按字母或时间顺序罗列,容易让人以为这是「同一层的 54 个选项」,实际上它们分布在三个完全不同的部署层级上。 ### RAG 别急着加新工具,这条清单本身证明了「工具不是瓶颈」 知识库 RAG 分类有 35 个开源项目,从 AnythingLLM 到 RAGFlow 到 GraphRAG,选择多到本身就是一个信号:**如果换个框架就能解决效果不好的问题,这个赛道不会卷出 35 个同类项目**。这和本站在[落地手册](https://usefulai.cloud/playbook/)里反复强调的判断一致——RAG 效果不好,九成问题出在文档切块、元数据缺失、缺少重排序这些检索环节,换更强的框架或模型对这类缺陷没有帮助。这份清单从侧面印证了这一点:如果「换工具」真的管用,市面上不会同时存在这么多功能高度重叠的 RAG 框架还都活跃在维护。 评论员视角 我想直接说清楚这类「awesome list」的通病:**收藏等于什么都没学**。这份清单没有难度分级,没有「先学哪个、再学哪个」的路径设计,一个刚入门的人和一个做了三年 LLM 工程的人看到的是同一张扁平列表。这不是这份清单独有的问题,是这类社区维护的汇总仓库共同的结构性缺陷——维护者的核心工作是「不漏掉新项目」,不是「教你怎么用」,这两件事的优先级天然不同。 更现实的问题是**链接的半衰期很短**。一份跨近 30 个分类、条目早已过千的清单,几个月后一定会有相当比例的项目停止维护、被更新的方案取代,静态排列的列表无法反映这种衰减。真正该培养的能力不是收藏得多全,而是拿到任何一个项目链接后,自己判断它是否还活着——看最近的 commit 时间、看 issue 有没有人回、看 star 曲线是不是已经走平。这个判断力清单给不了你,只能自己练。 ### 小语言模型训练:这一类条目少,恰恰是我认为最值得动手的 「小语言模型」和「小多模态模型」两个分类加起来不到 40 个项目,多是 minimind、MINI_LLM、tiny-llm-zh 这类从零训练一个几十兆到几亿参数模型的教程仓库。我认为**花一个周末真正跑通一次从零训练小模型的教程,比看十篇「大模型是怎么训练的」科普文更有用**——本站在[大模型的 5 阶段构建流水线](https://usefulai.cloud/insights/how-llms-are-built/)里讲的数据、预训练、监督微调、奖励建模、强化学习五个阶段,在这类教程仓库里全部可以用几张 GPU、几个小时的时间跑出一个微缩版本亲手验证一遍。看懂原理和亲手跑过一次,是两种完全不同程度的「理解」,后者才会在你调试真实项目时真正用得上。 ### Open o1/o3 复现区:133 条里的绝大多数是同一份作业的不同抄法 这是整份清单条目密度最高的分类,也是最容易被误读的一个。133 个仓库排在一起,看起来像是这个方向异常繁荣,但更准确的解读是:**DeepSeek-R1 公开训练思路之后,复现门槛骤降,大量团队和个人在用几乎同一套 GRPO/PPO 强化学习代码,跑不同规模、不同领域的变体**。这不是坏事——它证明这条技术路径已经从「少数实验室的黑魔法」变成「有清晰配方、谁都能试」的基础设施,这本身是这一年里 AI 领域最重要的变化之一。但对个人学习者的实操建议是:**不需要浏览全部 133 个仓库,挑 1-2 个 star 高、文档完整、更新活跃的仓库作为起点吃透一遍**,剩下的价值更多是「确认这条路径在不同场景下都能走通」,不是「每个都值得你花时间读」。 #### 这份清单里的信号 - Open o1 复现、论文汇总、Agent 框架条目最多,说明这几条赛道已经很卷 - 从零训练小模型、世界模型、龙虾 OpenClaw 条目少,是早期信号 - RAG 框架多达 35 个仍解决不了核心痛点,印证瓶颈在检索不在工具 - 133 个 Open o1 复现仓库,本质是同一套 RL 配方的不同抄法 #### 原始清单 GitHub 项目 WangRongsheng/awesome-LLM-resources,持续更新的大语言模型资源汇总,本文写作时涵盖近 30 个分类、条目早已过千。 [↗ 查看原始清单](https://github.com/WangRongsheng/awesome-LLM-resources) #### 我持保留意见的地方 - 清单没有难度分级和学习路径,新手和资深工程师看到的是同一张扁平列表 - 收藏这类清单本身容易被误认为「已经学习」,两者是两件事 - 链接半衰期短,静态排列无法反映项目是否还在维护 - 条目数量是拥挤程度的信号,不是质量或优先级的信号,别按顺序读 ## 常见问题 ### 看到一份几百上千条目的 awesome list,应该从哪里开始? 不要按顺序从头读。先看各分类的条目数量:条目最多的分类(本文写作时是 Open o1 复现约 133 条、论文汇总约 60 条、Agent 框架约 52 条)已经是拥挤赛道,条目最少但独立成类的分类(从零训练小模型约 26 条、龙虾 OpenClaw 约 5 条)才是早期信号。先用条目密度画出这张地图,再决定自己要深入哪一块,比逐条点开链接效率高得多。 ### LLM 微调框架应该选哪个?LLaMA-Factory、unsloth、veRL 有什么区别? 按算力和团队规模选,不是按清单排序选:个人或小团队、需要中文文档和最广模型覆盖,选 LLaMA-Factory;单卡、显存紧张、追求极致效率,选 unsloth(2-5 倍速度、更低显存);团队级、需要做规模化强化学习后训练,才需要 veRL 或 slime 这类专门框架。三者服务不同规模的用户,不是同一层的竞品。 ### 本地跑大模型和生产环境部署,应该用同一个推理引擎吗? 不应该。个人本地跑模型、要图形界面、零配置,用 ollama 或 LM Studio;生产环境要扛高并发、压吞吐量成本,用 vLLM 或 SGLang;需要同时调用多个厂商 API、按统一格式切换模型,用 LiteLLM 做适配层。这是三个不同的部署层级,不是同一层的选项,混着比较跑分没有意义。 ### RAG 效果不好,是不是应该换一个更新的开源框架? 大概率不是。awesome-LLM-resources 清单里 RAG 分类有 35 个功能高度重叠的开源项目,这个数字本身就说明「换框架」很少是真正的解法——如果换框架管用,市面上不会同时存在这么多同类项目还都在维护。真正决定 RAG 效果的是文档切块是否保留上下文、是否带标题日期等元数据、是否做重排序,这些检索环节的问题,换框架或换模型都无法修复。 ### 花时间去读一份 awesome list 里的全部链接,值得吗? 不值得,这是这类清单最容易被误用的地方。收藏或读完一份清单不等于学会了任何东西,清单的核心功能是「不漏掉新项目」,不是「教你怎么用」。更有效的方法是挑清单里 1-2 个 star 高、文档完整、近期仍有 commit 的项目,动手跑通一次,比浏览完整份清单的收获大得多。 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/hifi-umi-robot-data/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) 机器人操作 HiFi-UMI 数据采集 Sim2Real # 把机器人数据采集精度干到 3 毫米:HiFi-UMI 昂贵的遥操作数据变得可有可无? 机器人操作学习长期卡在三个老大难上:真机数据采集成本高到大多数团队玩不起、仿真训出来的策略搬到真机会「水土不服」(Sim2Real gap)、想要高精度数据就得依赖专用的遥操作采集硬件。HiFi-UMI 给出的不是一个单点技术突破,而是一套把采集装置、多传感器融合、仿真真机数据打通的组合方案,把抓取精度做到了 3 毫米级别。我认可这套系统工程的思路,但对「精度提升=昂贵遥操作数据可有可无」这个推论持保留态度。 **我的立场:**3 毫米精度是一个扎实的工程结果,但它解决的是「采集到的数据准不准」,不是「采集数据要花多少钱」。这篇论文的贡献在前者,标题党式的解读容易把它错误地包装成后者。下文会分开说这两件事。 ### 三个老大难:这篇论文想同时解决什么 机器人操作(manipulation)领域训练一个能抓取、能操作物体的策略,绕不开三件事:**数据从哪来、仿真能不能用、精度够不够**。真机采集需要人拿着遥操作设备一遍遍演示,一个任务的数据量往往要几百到几千条演示才够训,人力和时间成本极高;纯仿真训练成本低、可以批量生成数据,但仿真环境和真实世界的物理属性、传感器噪声、光照条件存在差异,策略在仿真里表现很好,一到真机就失效,这就是 Sim2Real gap;即便肯花钱采集真机数据,主流的开源采集方案(如 UMI)在抓取精度上也有天花板,精度不够会直接影响策略学到的动作质量。HiFi-UMI 想同时把这三件事往前推一步。 ### 方法路线:不是单点突破,是系统工程 HiFi-UMI 的做法更像是把整条数据生产线重新设计了一遍,而不是在某个模块里换一个更好的算法。核心包括三部分:**采集装置本身的改造**(提升手持采集设备的机械精度与稳定性)、**多传感器数据融合与校准**(把视觉、力觉等多路传感器信号对齐,减少单一传感器误差被放大的问题)、**把仿真数据和真机数据打通使用**(让仿真生成的数据也能真正提升真机策略的表现,而不是训练完还要额外做大量真机微调)。这三部分组合在一起,才是精度提升的来源,单看某一个模块未必能复现出同样的效果。 **图解 20**: HiFi-UMI 解决的三个老大难,以及它用组合方案对应哪一个 (适合:工程师向) 这张图想说清楚一件容易被标题带偏的事:**HiFi-UMI 的 3 毫米精度是三个模块组合的结果**,不是某个单一算法的胜利。如果只想借用其中一部分(比如只用它的传感器融合方法),未必能拿到论文报告的完整精度提升。 ### 3 毫米精度意味着什么,又不意味着什么 相比主流开源 UMI 方案,HiFi-UMI 在抓取精度上有明显提升,同时论文报告用更少的示教数据训出了更好的策略效果,也就是数据利用效率变高了。这对精细操作任务(比如插拔、对齐这类容错空间很小的动作)是实打实的改善——精度不够的数据,训出来的策略天生带着噪声上限,后面堆多少算力都补不回来。 但我要提醒一个容易被忽略的边界:**3 毫米级精度在哪些真实任务场景够用、哪些不够,论文给出的验证场景是有限的**。工业级精密装配可能仍需要更高精度或专用夹具配合;日常抓取、搬运这类任务本身容错空间大,3 毫米的提升边际收益有限。精度数字本身不是重点,重点是这个数字要放回具体任务场景里才有意义,脱离场景谈「精度提升了多少」容易变成一个好看但空转的指标。 ### 「昂贵遥操作数据变得可有可无」——我不同意这个推论 标题里这句话更像是一个吸引点击的疑问句,而不是论文本身的结论。HiFi-UMI 提升的是**单位数据的信息质量**(同样多的演示,采出更精确、更少噪声的数据),以及**数据利用效率**(更少数据训出更好效果)。这两件事合起来,意味着达到同样效果所需的演示数量可能减少,但不等于遥操作采集这个环节本身变得不重要——恰恰相反,正是因为采集环节的精度上去了,后续训练才更有效率。把「用更少数据也能训好」偷换成「数据采集变得可有可无」,是把「效率提升」读成了「重要性下降」,这是两件不同的事。 真正被削弱的,可能是**对采集数据量的依赖程度**,而不是**对采集数据质量的依赖程度**。如果这个方向继续往前走,我更期待看到的是「同样的采集成本、同样的团队规模,用 HiFi-UMI 这类方法能不能把过去需要 3 个月的数据采集周期压缩到 3 周」这类可直接对比的工程数据,而不是停留在精度数字本身。 评论员视角 这类论文最容易被二次传播时放大的,往往是「精度提升到 X 毫米」这种单一数字,而系统工程里最有价值的部分——把采集装置、传感器融合、仿真真机数据打通这三件事同时做对——反而在传播中被压缩掉了。对想复现或借鉴这套方法的团队,我的建议是先确认自己的任务场景对精度的实际需求是多少,再判断这整套组合方案是不是必要的投入,而不是看到「精度提升」就直接对标切换。 #### HiFi-UMI 做了什么 - 同时应对采集成本高、Sim2Real 差距、精度天花板三个老大难 - 采集装置改造 + 多传感器融合校准 + 仿真真机数据打通 - 抓取精度做到 3 毫米级别,相比主流 UMI 方案有明显提升 - 用更少示教数据训出更好效果,数据利用效率提升 #### 我持保留意见的地方 - 精度提升是系统工程的组合结果,单拿一个模块未必能复现 - 3 毫米精度在哪些任务场景够用,论文验证范围有限 - 「数据可有可无」的推论不成立——效率提升不等于重要性下降 - 更想看到的是采集周期/成本的直接对比数据,而不是精度数字本身 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/ai-coding-cost-shift/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) AI 编程 预判力 验证力 成本结构 # 「任何人都能用 AI 编程」:被忽略的成本平移 「任何人都能用 AI 编程」是这两年最流行的说法之一,听起来是在说编程门槛消失了。这篇文章提出的框架是把「用 AI 编程」拆成两种能力——**预判力**(知道要写什么、架构该怎么设计)和**验证力**(判断写出来的代码对不对、好不好)。AI 大幅降低的是预判力门槛,但没有降低验证力门槛,甚至让验证力变得更重要。我认同这个拆分,但想把它推得更进一步:这不是「门槛消失」,是成本从「写」这个环节,平移到了「审」和「返工」这两个环节。 **我的立场:**「谁都能用 AI 编程」这句话本身没错,但它默认了一个前提——写出代码就是终点。真实工程里,代码写出来只是开始,判断这段代码对不对、能不能维护、会不会在某个边界条件下炸掉,这件事的成本从来没有消失过,只是换了一个环节发生。搞不清这个平移,是很多人觉得「AI 编程效率提升」和实际体感不符的根源。 ### 「谁都能用」这句话,忽略了什么 这句话流行的原因很直接:不会写代码的人,现在也能靠 AI 生成一个能跑起来的程序。这确实是真的,也确实降低了「写出第一行能运行的代码」这件事的门槛。但「能跑起来」和「写对了」是两件不同的事——一段代码可以在演示场景下完美运行,同时在真实数据、边界条件、并发场景下埋着隐患。**门槛消失的是「产出代码」这个动作,没有消失的是「判断代码质量」这件事**,而后者恰恰是资深工程师区别于新手的核心能力。 ### 本文的框架:预判力 vs 验证力 文章提出的核心框架把「用 AI 编程」拆成两层能力: - **预判力**:在写代码之前,知道应该写什么、架构大致该怎么设计、哪种方案更合理。这是「知道往哪个方向走」的能力。 - **验证力**:代码写出来之后,判断它对不对、边界条件有没有考虑到、是否符合项目现有规范、会不会引入隐藏 bug。这是「知道走出来的路对不对」的能力。 AI 编程工具(Cursor、Claude Code 这类)本质上是在大幅降低**预判力**的门槛——不知道该怎么写某个功能,直接描述需求,AI 就能给出一个可用的实现方案,跳过了「先想清楚再动手」的过程。但**验证力门槛几乎没有下降**:AI 生成的代码依然需要人判断对不对,而且因为产出速度变快,需要验证的代码量反而更大,验证这件事变得更重要,不是更不重要。 ### 成本没有消失,只是换了环节 这是我想在文章框架之上补的一层:如果把「完成一个功能」的总成本看作一个固定或者缓慢下降的量,AI 编程做的事情是**把成本从「写」这一段搬到了「审」和「返工」这两段**。不会判断代码质量的人,用 AI 生成代码的那一刻看起来效率飙升,但这部分「没有被验证的风险」并没有消失,它会在后面某个时间点,以「线上 bug」「维护困难」「重构成本」的形式兑现,只是兑现的时间被推迟了。 **这也是为什么资深工程师和新手用同一个 AI 编程工具,体感差异巨大**:资深工程师的验证力本来就强,AI 帮他们省掉的是「预判力」这一层的时间成本,省下来的时间是纯增量;新手的验证力本来就弱,AI 生成代码之后,他们没有能力判断这段代码埋了什么坑,问题会一直潜伏,直到某次真实运行中爆发,此时排查成本远高于当初自己手写、自己踩坑、自己理解的成本。**这不是「AI 编程没用」,是「AI 编程对不同验证力水平的人,价值兑现的方式完全不同」**。 评论员视角 我认为这篇文章最有价值的地方,是把一个容易被简化成「AI 让编程更容易/AI 编程有很多坑」的二元讨论,拆成了一个可以分别观察的两层结构。行业里大多数「AI 编程提效」的宣传案例,统计的都是预判力门槛下降带来的产出速度,很少有案例去衡量验证力这一层的实际负担变化——这和本站在 [落地手册](https://usefulai.cloud/playbook/) 里提到的判断一致:厂商宣传的提效倍数大多缺少对照组,统计的是产出量而非交付质量。「任何人都能用 AI 编程」这句话如果不加限定条件,很容易让不具备验证力的人,把风险成本无意识地平移给了未来的自己,或者平移给了后面接手代码的同事。 ### 对个人和团队的现实建议 对个人来说,用 AI 编程工具提速的同时,不能跳过「自己读一遍、理解一遍」这一步,否则省下来的时间是在拿后续排查成本做抵押。对团队来说,如果引入 AI 编程工具的目标是提效,配套的 code review 强度、测试覆盖率要求应该同步提高而不是降低——因为产出代码量变大了,需要验证的总量也变大了,如果验证环节的投入没有跟上,团队整体的技术债积累速度只会更快,不会更慢。 #### 核心框架 - 用 AI 编程拆成两层:预判力(知道写什么)、验证力(判断对不对) - AI 大幅降低预判力门槛,验证力门槛几乎没变 - 产出速度变快,需要验证的代码量更大,验证反而更重要 - 「谁都能用」忽略了「写对」和「写出能跑的代码」是两件事 #### 我补充的判断 - 成本没有消失,是从「写」平移到了「审」和「返工」 - 验证力强的人(资深工程师),省下来的时间是纯增量 - 验证力弱的人(新手),风险被推迟兑现,排查成本反而更高 - 团队引入 AI 编程工具,review 和测试投入应该同步提高 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/anthropic-copyright-interpretation/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) Bartz v. Anthropic 版权 合理使用 法官 Alsup # 我们可能误读了 Anthropic 的「销毁书籍」:它争的从来不是版权,是知识的解释权 Bartz v. Anthropic 这场官司,大多数报道停留在「AI 公司用了盗版书训练模型,该赔钱」这个层面——15 亿美元、约 50 万部作品、每部约 3000 美元,数字确实抓眼球。但主审法官 William Alsup 的判决逻辑比这复杂得多:他把「用书训练模型」和「训练用的书是从哪来的」拆成了两件事分别判。我认为这个拆分本身,比赔偿金额更值得说清楚。 **我的立场:**大家争论的焦点如果停留在「AI 训练算不算侵权」,就已经跟错了这场判决真正划出的边界。Alsup 明确说了训练本身「高度转化性」(exceedingly transformative),受合理使用保护——这条线其实对 AI 公司是利好。真正让 Anthropic 掏钱的,是另一条完全独立的线:留存盗版副本建一个永久性「中央图书馆」,这件事本身不受合理使用保护,跟这些书后来有没有被拿去训练模型没有关系。这个区分,才是这场判决对后续所有类似案子最有参考价值的部分。 ### 判决拆成了两件事,不是一件事 Alsup 在 2025 年 6 月的判决里,把 Anthropic 的行为拆成了两条独立的线索来判断: - **用书训练 LLM 这个行为本身**——法官认定这是「高度转化性」的合理使用,无论书是合法购买获得,还是(在训练这个动作本身的意义上)来自其他渠道,训练这件事本身受合理使用保护。 - **下载并留存盗版副本,建立一个永久性「研究图书馆」**——Anthropic 从 LibGen 和 Pirate Library Mirror 这类盗版站点下载了数百万本书,不仅用于训练,还留作公司内部长期资源库。法官认定这一部分不受合理使用保护,这是纯粹的版权侵权。 换句话说,**「AI 训练需要用书」这件事本身没有被判违法**,被判违法的是「用盗版渠道拿书、且长期留存」这个动作。这个区分解释了为什么后续 15 亿美元的和解,赔的是「盗版下载并留存」这部分,不是「训练模型用了受版权保护的内容」这部分。 ### 大家争的焦点为什么搞错了 公众讨论习惯把这类案子简化成「AI 用了我的书,该不该赔」,这个框架下,唯一的问题是「用了多少、赔多少」。但 Alsup 的判决实际上在回答一个更根本的问题:**谁有权决定一本书可以被怎样使用、以什么渠道被获取**。训练本身被认定为转化性使用,意味着「内容被 AI 消化后用于生成新内容」这条路径,本身不需要额外授权——这实际上是在重新划定「使用」和「获取」这两件事各自的权利边界:使用方式可以被判定为高度转化、无需额外授权;但获取渠道必须合法,无法用「反正后来是拿去做转化性使用了」来倒推获取行为本身也合法。 这才是我认为「知识的解释权」这个说法比「版权赔偿」更准确的地方:这场判决没有回答「AI 能不能用书」,它回答的是「谁有资格决定一份内容进入训练管线的正当路径是什么」。出版社、平台、盗版站点、AI 公司之间关于「谁能合法地把内容变成训练数据」的博弈,才是这场官司真正的赌注,赔偿金额只是这场博弈的一个阶段性结算。 评论员视角 我认为这个先例最大的影响不在 Anthropic 身上,而在于它给行业里所有还没被起诉的公司划了一条清晰的操作红线:**合法获取的内容用于训练大概率能获得合理使用的保护,但通过盗版渠道获取并留存,无法靠「后续用途正当」来洗白**。这意味着接下来这类诉讼的焦点会从「AI 训练是否侵权」这种宏大命题,转移到更具体、更可举证的「数据来源是否合法」这个技术性问题上——这对原告方(作者、出版社)反而是更容易打赢的战场,因为证明「渠道是盗版站点」比证明「转化性使用不成立」容易得多。 我也想指出这个判决留下的一个悬而未决的问题:如果一家公司从一开始就只用合法购买的内容训练,这场官司里对 Anthropic 不利的那部分风险就完全不存在。这意味着「数据来源合规」这件事,正在从一个道德加分项,变成一个有真实法律成本差异的工程决策——数据团队现在必须像对待安全漏洞一样对待数据来源审计。 #### 判决拆成了什么 - 用书训练模型本身:认定为「高度转化性」合理使用 - 下载留存盗版副本建永久图书馆:不受合理使用保护,判定侵权 - 后续和解:约 15 亿美元,覆盖约 50 万部作品,每部约 3000 美元 - 盗版来源:LibGen 与 Pirate Library Mirror #### 我的判断 - 真正的赌注是「谁有权决定内容进入训练管线的正当路径」 - 数据来源合规正在从道德加分项变成有真实成本差异的工程决策 - 接下来的诉讼焦点会转向更容易举证的「数据渠道是否合法」 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/scaling-law-extrapolation-illusion/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) Scaling Law 外推 经验拟合 # Scaling Law 不是物理定律,是「外推幻觉」 「参数越多、数据越多、算力越多,模型效果越好」——Scaling Law 这条曲线被行业里很多人当成类似牛顿定律那样确定性成立的规律来引用,用来论证「继续加大投入必然继续有回报」。这篇文章想戳破的是这个类比本身:Scaling Law 从头到尾是对已有实验数据点的**经验拟合**,不是对未来必然成立的物理规律,把两者混为一谈,就是一种「外推幻觉」。 **我的立场:**Scaling Law 本身是真实、有用的观察——过去几年模型性能随参数量、数据量、算力投入按幂律关系提升,这个趋势在已验证的区间里确实成立,OpenAI、DeepMind 等机构的多篇论文都给出过一致的拟合结果。但「在观测区间内拟合得好」和「可以无限外推到观测区间之外」是两件不同的事,前者是统计工作,后者是一个未经证明的假设。行业里最大的认知偏差,就是把「拟合得很准」偷换成了「规律必然成立」。 ### 物理定律和经验拟合的根本区别 物理定律(比如万有引力定律)之所以能被称为「定律」,是因为它背后有可以独立验证的机制解释,且这套机制在任意尺度下都成立,不依赖于「过去观测到的数据点恰好落在这条曲线上」。Scaling Law 完全不是这种东西:它是研究者拿一批不同规模的模型跑出的实际性能数据,画在对数-对数坐标(log-log plot)上,发现这些点大致落在一条直线附近,于是拟合出一条幂律曲线。**这条曲线描述的是「过去这批实验里发生了什么」,不是「模型规模和性能之间存在某种必然的因果机制」**。没有人能从第一性原理推导出为什么性能提升必须服从这个具体的幂律指数,这个指数本身是拟合出来的经验参数,换一批训练数据、换一种架构,指数就可能变。 ### 「外推幻觉」具体错在哪 外推幻觉的核心问题是:**一条曲线在已观测区间内拟合得再好,也不能保证它在区间之外继续成立**。这在统计学里是一个基础常识——任何有限的数据点都可以被无数条不同的曲线完美拟合,选择「继续沿同一条幂律曲线走下去」只是众多可能性中最简单、最符合直觉的一种,不是唯一正确的一种。现实中已经出现过 Scaling Law 在某个尺度之后出现拐点、边际收益骤降、甚至某些能力提升停滞的案例——这些都是「外推失效」的直接证据,而不是异常噪声。**把一条基于历史数据画出的趋势线,当成对未来的确定性保证,本质上和把过去三年股价涨了就假设明年一定继续涨是同一种逻辑错误**,只是套了一层数学公式的外壳,看起来更「科学」。 评论员视角 我认为 Scaling Law 被过度神化,背后有一个不便明说的商业动机:如果 Scaling Law 是「定律」,那么继续投入更多算力、融更多钱去堆更大的模型,就是一件风险极低、几乎确定有回报的事——这个叙事对需要说服投资人持续加注的公司极其有利。但如果承认它只是「目前观测区间内的经验拟合,外推存在不确定性」,继续加大投入就变成了一个需要独立论证的赌注,说服力立刻下降。**把经验规律包装成确定性定律,是一种在技术叙事之外发生的资本叙事需要**,这也是为什么这个类比在融资 PPT 和媒体报道里出现的频率,远高于它在严肃的技术论文里被真正当作「定律」使用的频率。 对个人判断力的现实建议是:**看到任何用 Scaling Law 论证「未来必然如何」的表述,先问一句这个外推是否已经超出了已验证的观测区间**。在区间内引用它是合理的技术判断,超出区间外推则是一个需要额外证据支撑的假设,两者不能用同一种确定性的语气去表达。 #### 核心论点 - Scaling Law 是对已观测数据的经验拟合,不是物理定律 - 拟合得好≠可以无限外推,这是两件不同的事 - 已有案例显示某些尺度之后出现拐点、边际收益骤降 - 幂律指数本身是拟合参数,换数据/架构可能改变 #### 我的判断 - 把经验规律包装成「定律」,背后有资本叙事的动机 - 「继续投入必然有回报」的确定性语气,需要额外证据支撑 - 判断标准:外推是否已超出已验证的观测区间 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/bridgevla-plus-plus/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) BridgeVLA++ 3D 操作 VLA 时空记忆 # 一个框架同时吃掉 3D 操作的三个老大难——BridgeVLA++ 的务实解法 机器人 3D 操作(manipulation)领域这两年的主流打法是把基座模型做得更大。BridgeVLA++(中国科学院 + 字节跳动 Seed)反过来做了一件「不酷」但务实的事:冻住原有的 PaliGemma 3B 骨干网络不动,只额外挂上一个约 2.7 亿参数、约 9.2% 开销的时空记忆模块,就把记忆依赖型任务的成功率从 18.9% 拉到 96.0%。我认为这篇论文的价值不在排行榜数字,而在于它证明了「给对地方打补丁」有时比「把整个模型做大」性价比更高。 **我的立场:**这篇论文最值得关注的不是它刷新了榜单,是它选择的修复方式——不动基座模型,只在旁边加一个小而精准的记忆模块。这代表一种和「继续堆大模型」完全相反的技术路线,如果这个模式能被验证具有普适性,会显著降低小团队参与机器人 3D 操作研究的门槛。 ### 3D 操作领域的三个老大难 把 3D 感知信号接入视觉语言模型(VLM)做机器人动作预测,长期存在三个难点:**3D 输入和 2D 预训练的视觉语言模型天然不对齐**(点云数据和 VLM 习惯处理的 2D 图像在表示空间上不一致,直接接入效率低);**动作预测缺乏统一的输出空间**(不同任务的动作表示方式五花八门,模型很难复用同一套预测机制);**需要记住任务早期发生的事情时严重失效**(大多数 3D VLA 模型是「无记忆」的,只看当前这一帧做决策,遇到需要参照几步之前场景状态的任务就会崩)。前两个问题在前作 BridgeVLA 里已经通过「把 3D 输入投影成多视角 2D 图像、用 2D 热力图统一动作预测」的方式解决;BridgeVLA++ 要补的是第三个——记忆缺失。 ### 务实解法:不动骨干网络,只加一个记忆模块 BridgeVLA++ 的做法是保留 BridgeVLA 冻结的 PaliGemma 3B 骨干网络,额外挂上一个**时空记忆模块**,参数量约 2.6977 亿,相当于给 3B 规模的骨干网络增加约 9.2% 的开销——不是重新训练一个更大的模型,是精准地在旁边加一块专门处理记忆的组件。这个模块包含两部分:**时间记忆**(缓存锚点视角、相邻关键帧、自适应选取的子目标关键帧)和**空间记忆**(在当前精细操作阶段的相机视角下,重新渲染任务开始时的初始点云)。这套组合让模型在执行到任务后期时,仍能「回头看」任务早期的场景状态,而不是只依赖当前这一帧的信息做判断。 ### 务实到什么程度:具体数字说话 论文报告 BridgeVLA++ 在 RLBench 上平均成功率达到 **93.7%**(基线 BridgeVLA 为 90.5%),在存在分布偏移的 COLOSSEUM 基准上达到 **65.2%**——这两项提升幅度不算惊艳,说明记忆模块对「不特别依赖记忆」的常规任务帮助有限。真正的差异出现在**专门测试记忆依赖能力的 RMBench**(双臂、需要记住早期状态的基准):无记忆的 BridgeVLA 只能拿到 **18.9%**,加上记忆模块的 BridgeVLA++ 跳到 **96.0%**;单臂的 MemoryBench 上更是达到 **99.7%**。真机测试用 Franka Research 3 和 Dobot CR5A 两款机械臂,每个任务只用 **10 条示教演示**就完成验证。**这个数据分布本身就是最有说服力的论证**:记忆模块几乎不影响常规任务的表现,但在真正需要记忆的任务上带来了接近五倍的提升,说明这个补丁精准地打在了问题的根子上,不是靠整体堆参数换来的普遍性提升。 评论员视角 务实之外,这篇论文也有需要如实说的代价。**推理速度从每步 0.35 秒降到 0.57 秒**(RTX 4090 上测得),对需要快速反应的实时控制场景不是免费的午餐;缓存关键帧的槽位数量需要按具体基准手动调优(RMBench 上设为 12,其他场景设为 2),这意味着把这个记忆模块直接「插拔」到全新任务上未必是零成本的,调参本身仍需要经验。真机验证虽然用了两款真实机械臂,但场景是为了公平对比手动复现的实验室环境,不是开放世界的压力测试——论文里也没有和商业闭源 VLA 模型的直接对比,长时间跨度、面对全新物体时的失效表现也没有详细披露。 但即便有这些局限,我认为这篇论文指出的方向值得关注:**把预训练好的 VLM 当作固定底座,只在记忆、动作头、对齐这些外围组件上做文章**,这条路线如果继续被验证有效,会实质性降低小团队参与机器人操作研究的门槛——不需要重新训练一个基座模型,只需要在别人训好的底座上做精准的外科手术式改进。这和过去两年机器人研究普遍依赖「把基座做得更大」的主流路线是相反的方向,值得继续观察是否能推广到记忆模块之外的其他能力缺陷上。 #### 关键数据 - 记忆模块约 2.7 亿参数,占 3B 骨干约 9.2% 开销 - RLBench 93.7%(基线 90.5%),COLOSSEUM 65.2% - RMBench 从 18.9% 跳到 96.0%,MemoryBench 达 99.7% - 真机测试:Franka Research 3 / Dobot CR5A,每任务 10 条示教 #### 我持保留意见的地方 - 推理耗时从 0.35 秒/步增至 0.57 秒/步,实时控制场景不是免费的 - 缓存槽位数量需按基准手动调优,非真正意义上的即插即用 - 真机验证是受控实验室场景,缺少开放世界压力测试与闭源模型对比 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/harness-self-improvement-skepticism/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) Agent Harness 自我改进 AHE # 当所有人都在聊 Harness 能"自我改进"时,我想泼一盆冷水 最近一篇论文(Agentic Harness Engineering,简称 AHE)演示了让一个 Agent 自动读取失败日志、修改另一个 Coding Agent 的工具、中间件和系统提示词,十轮迭代后把 Terminal-Bench 2 的 pass@1 从 69.7% 提到 77.0%,超过了人工精心设计的 Codex CLI(71.9%)。这个结果被不少人解读成"Agent 已经能自我改进了"。我认真读完论文本身的消融实验和局限章节后,认为这个解读过于乐观——论文自己给出的数据里,藏着一个被大多数转述忽略的"回归盲区"问题。 **我的立场:**这篇论文的工程贡献是真实的——把「不可观测的手工调参」变成「可观测、可回滚的结构化编辑」,这个思路本身值得肯定。但「自我改进」这个词暗示的是一个可以无监督持续运转、越改越好的闭环,而论文数据显示的是:这个循环能可靠地识别「哪里该修」,却几乎无法预见「这次修改会在哪里捅出新的窟窿」。一个没有能力预见自己会造成什么新问题的系统,谈不上真正意义上的自我改进,只能叫「在人类持续巡检下的半自动调优」。 ### 结果确实亮眼:10 轮迭代跑赢人工设计的 Harness AHE 的做法是把 Coding Agent 的"外围组件"——系统提示词、工具实现、中间件、长期记忆——都暴露成可编辑的文件,让一个"进化 Agent"读取失败轨迹分析报告,自主决定要改哪个组件、怎么改,每次编辑都要写明预测会修复哪些任务、可能会牵连哪些任务的回归风险,下一轮再核验这个预测对不对。跑了 10 轮迭代之后,在 Terminal-Bench 2 的 89 个任务上,pass@1 从种子版本的 69.7% 提升到 77.0%,超过了三个人工设计的 Harness(opencode 47.2%、terminus-2 62.9%、Codex CLI 71.9%),也超过了两个同样从种子版本自我进化的对比方法 ACE(68.9%)和 TF-GRPO(72.3%)。跨任务迁移测试里,这套进化出来的 Harness 不需要重新训练,直接搬到 SWE-bench-verified 上还能小幅提升(75.2%→75.6%),换到另外三个不同厂商的基座模型上也都有正向收益(+2.3 到 +10.1 个百分点)。这些数字是扎实的,我不否认。 ### 被忽略的关键数据:组件不是简单加总,回归预测几乎是瞎猜 论文自己做的消融实验(拆开看每个组件单独的贡献)暴露了两个问题,恰恰是这些细节没有被大多数转述提及: - **组件效果不能线性叠加。**把长期记忆、工具、中间件三个组件分别单独换进种子版本,各自带来 +5.6、+3.3、+2.2 个百分点的提升,加起来应该有 +11.1 个百分点,但把三者都用上的完整版本,实际提升只有 +7.3 个百分点。论文对此的解释是"组件之间存在非加性交互"——记忆、中间件、系统提示词都倾向于推动同一种收尾验证行为,叠在一起之后,Agent 会把回合数浪费在重复的自我核查上。这说明"多加几个自我改进的模块"不是免费的,模块之间会互相争抢同一份任务预算。 - **修复预测靠谱,回归预测几乎是瞎猜。**这是我认为最该被放大的数字:进化 Agent 对"这次编辑会修好哪些任务"的预测,精确率 33.7%、召回率 51.4%,大约是随机瞎猜基线的 5 倍,说明它确实是有依据地在下判断。但对"这次编辑可能会搞坏哪些任务"的预测,精确率只有 11.8%、召回率只有 11.1%,只比随机瞎猜基线高出约 2 倍——论文原话把这个现象叫做**"回归盲区"(regression blindness)**:这个 Agent 能讲清楚一次修改为什么应该有帮助,但几乎说不出这次修改会在别的地方捅出什么新问题,这正是整个进化曲线在图上会忽上忽下、不是单调上升的根本原因。 评论员视角 我想直接指出这个问题的严重性:**一个只能事后归因、无法提前预见自己会造成什么新损害的系统,用在需要持续、无监督运行的生产场景里是危险的**。论文的实验设置本身也承认了这一点——研究者全程盯着攻击面(哪些文件能改、哪些不能改)、每一轮都有明确的评测基准告诉系统对错,任何"进化"方向錯了都能立刻被下一轮的评测打回去。这是一个有安全网、有裁判、迭代速度可控的受控实验环境,跟"扔给它一个真实生产系统,让它自己连续跑几周"完全是两件事。论文在 Limitations 章节里也主动说了这句实话:这套系统应该被当作"受控的研究原型",不是"成熟的自主自我改进系统"。 「自我改进」这个词本身没问题,但它经常被不加限定地传播成"AI 已经能在没有人盯着的情况下持续变强",这个推论论文的数据并不支持。真正准确的说法应该是:**在有裁判、有回滚机制、迭代节奏被人为控制的环境里,让一个 Agent 系统性地识别并修复另一个 Agent 的缺陷,比纯手工调参更高效**——这仍然是一个了不起的工程结果,但和"自主自我改进"之间,还差着"能不能预见自己造成的新问题"这一整层能力。 #### 关键数据 - 10 轮迭代:Terminal-Bench 2 pass@1 从 69.7% 提升到 77.0% - 超过人工设计的 Codex CLI(71.9%)与两个自我进化基线 - 三组件单独贡献加总 +11.1pp,实际叠加只有 +7.3pp - 修复预测精确率/召回率 33.7%/51.4%,回归预测仅 11.8%/11.1% #### 我的判断 - 「回归盲区」是这篇论文最该被关注、却最常被忽略的数据 - 实验环境有裁判、有回滚机制,不等于无监督生产场景可用 - 论文自己也承认这是「受控研究原型」,不是成熟自主系统 - 真正的能力缺口:能不能预见自己这次修改会造成什么新问题 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/openai-chatgpt-global-usage/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) OpenAI ChatGPT 使用数据 # OpenAI 第一次把家底摊开:全球都在用 ChatGPT,但用在了不同的事上 OpenAI 联合哈佛经济学家 David Deming,基于 150 万条对话样本发布了迄今为止规模最大的 ChatGPT 消费级使用研究。这不是一份公关稿式的用户数字播报,是一份写进 NBER(美国国家经济研究局)工作论文的正式研究,数据颗粒度细到"人们在用 ChatGPT 问、做、还是纯粹表达"。我认为这份报告最有价值的地方,不是"多少人在用",是它把使用行为拆成了三种性质不同的类别,而三者的增长速度并不一样。 **我的立场:**行业里谈 ChatGPT 的价值时,习惯性聚焦在"帮你完成任务"这个叙事上(写代码、写文案、做分析)。但这份数据显示,真正占比最大、增长最快的类别是"Asking"——把 ChatGPT 当顾问用,寻求建议和信息,而不是让它代劳执行。这个发现如果成立,意味着行业对"AI 生产力工具"的价值判断框架本身可能是偏窄的,AI 更大的经济价值一部分来自"帮你想清楚",不完全是"帮你做完"。 ### 三分法:Asking、Doing、Expressing 报告把使用模式拆成三类:**Asking(约 49%)**——用户向 ChatGPT 提问、寻求建议,把它当成一个可以随时咨询的顾问,这类用法评分最高、增长最快;**Doing(约 40%)**——任务导向的交互,包括起草文本、做计划、写程序,让模型去产出成果或完成具体工作,其中约三分之一发生在工作场景;**Expressing(约 11%)**——既不是提问也不是执行任务,通常涉及个人反思、探索和娱乐性使用。**这个三分法本身就是对"AI=生产力工具"这个默认叙事的一次纠偏**:接近一半的使用行为,价值不体现在"产出了什么",而体现在"帮用户想清楚了什么",这部分价值传统的生产力统计口径基本捕捉不到。 ### 工作与生活的分野:70% 用在了工作之外 报告的另一个关键数字:**约 30% 的消费级使用与工作相关,约 70% 与工作无关**,且两个类别都在持续增长。三大主题——实用指导、信息查询、写作——加起来占了四分之三的对话,其中写作是最常见的工作类任务,编程和自我表达类使用相对小众。有意思的是,工作场景下的使用模式和非工作场景明显不同:**在工作相关的对话里,执行类任务(写作、编辑、分析)的占比超过 50%,是非工作场景的两倍以上**——工作场景更偏向"帮我做完这件事",非工作场景更偏向"帮我了解/想清楚这件事",这也印证了三分法背后的场景差异不是随机的,是两种完全不同的使用心态。 ### 全球增速不均:低收入国家的增长速度是高收入国家的 4 倍以上 报告特别指出,截至研究窗口期,**低收入和中等收入国家的 ChatGPT 采用增速超过高收入国家的 4 倍**,是一个明确的"追赶型增长"模式。这和另一份 OpenAI 后续发布的采用率数据互相印证:2026 年最快增长的国家名单里,拉美、亚太、非洲地区占了大多数席位,说明 ChatGPT 的全球扩张正在从"发达国家早期用户"阶段,切换到"发展中国家追赶"阶段。这个趋势和多数科技产品的全球扩散曲线一致,但增速差异之大(4 倍以上)值得单独拎出来看——它意味着两三年后讨论"谁在用 AI"这个问题时,答案的地理分布会和今天完全不同。 评论员视角 我想提一个这份报告没有回答、但很关键的问题:**"Asking"这一类用法评分最高、增长最快,这到底是好事还是隐忧**?把 ChatGPT 当顾问用,意味着大量用户在获取建议、判断、甚至情感支持时,依赖的是一个没有对错反馈机制、容易讨好用户的系统(这一点在本站的[AI 入门](https://usefulai.cloud/primer/)里已经拆解过——强化学习训练出的模型天然倾向给出让人满意而非正确的答案)。报告只统计了"用户觉得这个回答有帮助"的评分,没有统计"这个建议事后被验证是否正确"。**使用规模和使用质量是两件独立的事**,这份报告证明的是前者在快速增长,后者目前没有被系统性追踪,这恰恰是接下来最值得研究的空白。 另外要提醒一点:这份数据只覆盖 ChatGPT Free/Go/Plus/Pro 这些个人消费级账户,**不包含企业版和 Codex 的使用数据**,报告本身也承认这会低估商业和技术类用途的真实占比。看这份报告时不能直接把它当成"ChatGPT 全部使用场景"的完整画像,它反映的是个人消费端的行为模式,企业内部的用法分布可能是另一幅完全不同的图景。 #### 关键数据 - 三分法:Asking 约 49%、Doing 约 40%、Expressing 约 11% - 约 30% 使用与工作相关,约 70% 与工作无关,两者都在增长 - 工作场景执行类任务占比超 50%,是非工作场景的两倍以上 - 低收入国家采用增速是高收入国家的 4 倍以上 #### 我的判断 - 「AI=生产力工具」的默认叙事偏窄,近半数使用价值在「想清楚」而非「做完」 - Asking 类用法增长最快,但报告未追踪建议质量,只追踪满意度评分 - 数据仅覆盖个人消费账户,企业与 Codex 用法可能是完全不同的图景 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/) --- > 来源:UsefulAI(实用 AI / Useful AI)— https://usefulai.cloud/insights/google-gemini-robotics-er2/ > 作者:CarryChang · 最近更新:2026-09-13 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) Gemini Robotics ER 2 具身推理 安全性 # Google 用 ER 2 做了一件「不酷」的事,但可能做对了 2026 年 7 月 30 日,Google DeepMind 同时发布了 Gemini Robotics 2、Gemini Robotics ER 2、Gemini Robotics On-Device 2 三个模型。宣传素材里最吸睛的是人形机器人 Apollo 2 和机械臂协同作业的演示视频,但我认为这次发布里真正值得关注的,是一件不适合拍进演示视频的「不酷」的事——ER 2 把大量精力投入到安全指令遵循和人体距离感知这两项枯燥的安全基准上,安全指令遵循准确率从上一代的 47.2% 跳到 97.9%。这个选择在具身智能这个热衷于秀"能做什么"的领域里,是一个反直觉的优先级排序。 **我的立场:**具身智能领域的发布节奏普遍是"能力优先"——先秀灵活的手指、协同的多机器人、复杂的多步任务,安全性能是事后补的一句话。ER 2 这次的数据分布反过来:一些面向能力的指标(比如进度分类)提升有限,安全相关指标的提升幅度远超其他任何一项。我认为这才是"可能做对了"的地方——机器人一旦进入有人共处的真实物理空间,安全性不是锦上添花的加分项,是能不能规模化部署的前提条件,这个优先级排序比任何一个具体的性能数字都重要。 ### ER 2 是什么:机器人的"高层大脑",不直接控制电机 Gemini Robotics ER 2(Embodied Reasoning,具身推理)是一个专门负责"思考"而不负责"动手"的模型——它接收连续视频、音频、文本输入,对物理场景进行推理,规划多步骤任务,然后把具体的执行动作交给下层的视觉-语言-动作模型(VLA)或人类远程操作员去完成。可以把它理解成站在机器人旁边的项目经理,不亲自搬东西,但决定接下来该搬哪个、怎么搬、什么时候算搬完。它取代了 2026 年 4 月发布的 ER 1.6,同批还发布了负责实际动作执行的 Gemini Robotics 2(全身人形控制)和离线版 Gemini Robotics On-Device 2。 ### 能力数字:有提升,但没有夸张到不真实 在成功检测(图像/视频判断任务是否完成)、具身推理问答(ERQA)、通用仪表读数这几项能力型基准上,ER 2 相比同批对比模型(包括 Opus 5、GPT 5.6 Sol、上一代 ER 1.6)都拿到了最高分,但提升幅度总体温和,多数在 4-13 个百分点之间。**进度分类(判断任务完成到了百分之几)准确率是 57.4%**——这个数字单看不高,但报告说明这已经是同批对比模型里的最高分,说明这类"持续追踪任务进展"的能力,目前全行业都还没做到能拿出手的水平。**精准时刻定位(判断关键动作发生的确切帧)准确率 91.3%,平均误差 0.96 秒,执行速度是上一代的 4 倍**——这是本次更新里少数几个数字既好看、又有实际意义的指标,因为它直接决定机器人能不能在正确的瞬间停止一个动作(比如倒咖啡时准确判断该停手的那一刻)。 ### 真正的反差:安全性指标的提升幅度远超能力性指标 这是我认为最该被拎出来单独说的一组数据:**安全指令遵循准确率,ER 2 达到 97.9%,而上一代 ER 1.6 只有 47.2%**——不到 50% 意味着上一代模型对"哪些指令不该执行"的判断基本等于随机;**人体近距离感知(1 米内)准确率,ER 2 达到 93.0%,上一代只有 51.1%**。相比之下,同批对比的 Opus 5 和 GPT 5.6 Sol 在这两项上的分数(95.9%/91.4% 和 77.1%/83.4%)本来就不低,ER 2 这次是在一个别人已经做得不错的维度上,把自己从明显落后拉到全面领先。**安全性指标从"及格线以下"跳到"全场最高",这个提升幅度和优先级投入,远超任何一项能力型指标的进步**。DeepMind 还专门引入了一个新基准 ASIMOV-Agentic,测试模型是否会拒绝执行下层 VLA 发出的不安全工具调用,以及是否知道该在什么时候向人求助而不是自己瞎猜。 评论员视角 「不酷」这个判断的依据是:安全指令遵循、人体距离感知这类指标,天生不适合做成演示视频里的高光时刻——没有人会为"机器人正确地没有撞到人"这件事鼓掌,但这恰恰是机器人能不能被允许进入家庭、工厂、医院这些有人共处空间的前提。**具身智能行业过去一年的注意力,明显更多投向"能不能做复杂动作",而不是"会不会在意外情况下做错事"**,ER 2 这次的数据分布是少数几个把资源明确投向后者的信号。 但我也要提一个不该被忽略的警示:**57.4% 的进度分类准确率,报告自己也承认这不是一个适合无监督运行在工厂产线上的数字**。「同批最佳」和「可靠到能放手不管」是两个完全不同的标准,这中间的差距,恰怕才是接下来十二个月具身智能领域真正的看点——不是又出了哪个更炫的演示视频,是这类基础可靠性指标能不能追上安全性指标的进步速度。目前 ER 2 的开放程度也值得注意:它是整个 Gemini Robotics 系列里唯一一个可以通过 Gemini API 直接调用、不需要排队等合作伙伴资格的模型,负责实际动作执行的 VLA 模型仍然只对合作伙伴开放,这个开放节奏差异本身也是一个值得持续观察的信号。 #### 关键数据 - 安全指令遵循:47.2% → 97.9%;人体近距感知:51.1% → 93.0% - 精准时刻定位 91.3%,误差 0.96 秒,速度为上一代 4 倍 - 进度分类准确率 57.4%,同批最高但报告自认不适合无监督部署 - 唯一通过 Gemini API 开放调用的具身推理模型,VLA 执行模型仍需合作资格 #### 我的判断 - 安全性指标提升幅度远超能力型指标,是反直觉但正确的优先级排序 - 「同批最佳」不等于「可靠到能放手不管」,中间的差距才是真正看点 - 安全性能拍不出炫酷演示视频,但是规模化部署的真正前提 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 15 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理、LLM 资源地图。](https://usefulai.cloud/insights/)