附录 · 边界深读

大模型能力边界

主线第 6 站的加厚版:模型族对照、权威榜单入口、更多验收方法。 若还没走主线,请先 回第 6 站 练过分档与小测。

大模型能力边界示意

一句话先记住

大模型是概率续写与模式匹配的超级引擎,不是全知真理机,也不是自动免责的员工。 旗舰模型(如 GPT‑5.6 Sol、Claude 高端档、Gemini 高端档等)在写作、编程、推理上很强, 但在事实时效、精确计算、长尾安全、开放世界操作上仍有硬边界——要用工具、检索、流程与人审来补。

A. 「能力边界」是什么

金字塔 · 先结论 → 再要点 → 再专业

大模型很强,但不是全知员工——边界就是「它稳定做对」与「你必须接管」之间的那条线。

  • 是什么:在特定任务、数据与安全约束下,模型做对的概率范围;超出不是再问一遍就能稳。
  • 和你有关:决定能不能直接交客户、用 Sol 还是 Luna、要不要搜索/人审。
  • 怎么判断:公开榜单粗筛 + 厂商说明 + 你自己的业务样例(最重要)。
展开专业表述

能力边界(capability boundary)可理解为:模型在给定任务分布、提示/工具配置与对齐策略下的可靠工作域。域外失败模式包括幻觉、过期知识、工具误调用、越权尝试等,需用 RAG、工具校验、评测集与人在回路补齐——详见本站 评测与护栏。

🧭
类比

极强但会自信说错的顾问:方案写得好,药方/判决/股价不能盲信。边界 = 你必须自己负责验收的那条线。

B. 八个边界维度(结构清单)

读任何「最强模型」新闻时,用这张表对照,避免被单一分数带跑。

1
知识截止与时效
训练数据有截止日期;之后事件需联网/RAG。例:GPT‑5.6 家族公开说明知识截止约 2026-02-16(以 OpenAI 页面为准)。
2
幻觉与事实性
会生成流畅但错误的内容。引用、检索、工具校验可降风险,无法用「更强模型」完全消灭。
3
推理与规划
多步逻辑、数学、长程规划显著进步,但复杂证明、精密数值、对抗性谜题仍会错。需要过程展示与验算。
4
工具与 Agent 可靠性
会调工具 ≠ 每次都调对。循环可能空转、重复、做错参数。必须设步数/预算/急停(见通识 Loop)。
5
上下文窗口与「失忆」
窗口再大也有限;中段信息更易被忽略。长项目要摘要、外置记忆、分段任务。
6
多模态与身体世界
看图/听声/生成媒体能力在进步,但精细视觉计量、物理操作仍远不如专用系统。具身见 ⑥。
7
安全、拒答与合规
对齐策略会拒答或改写;也可能被越狱。企业场景需自有护栏与审计,不能只靠模型默认策略。
8
成本 · 延迟 · 配额
旗舰档贵且可能更慢;快档便宜但上限低。生产系统要按任务路由:简单→Luna 类,难→Sol/Opus 类。

(首页已用独立示意图讲「别全信」;本页不重复配图,直接看维度清单与榜单。)

C. 主流大模型族(国内外)怎么放进地图

不背参数量。按「谁出品 · 适合什么 · 边界提醒 · 官方入口」读。

家族 / 代表 常见定位 能力边界提醒(通识) 官方入口
OpenAI GPT‑5.6
Sol / Terra / Luna
旗舰三档:最强 / 均衡 / 快省 仍有知识截止;Agent 任务需工具与人审;档位选错会贵或不够用 OpenAI 预览说明
Anthropic Claude
(Opus / Sonnet 等档位随版本变)
长文、编程、谨慎对齐风格突出 安全策略更严时可能多拒答;事实仍需核验 anthropic.com/claude
Google Gemini 多模态与搜索生态结合 版本线多,注意产品名≠同一能力;专用场景仍要评测 Gemini 模型页
DeepSeek 高性价比推理/代码路线常被关注 开源/API 版本能力不同;合规与部署环境要自评估 deepseek.com
通义 Qwen 等阿里系 中文场景与开源权重活跃 开源型号众多,选对尺寸与是否 Instruct GitHub Qwen
文心 / 豆包 / 混元 / 智谱 等 国内产品与 API 生态 能力随版本快变;以官方文档与你的业务集为准 各厂商控制台 / 开放平台(以官网为准)
开源通用
Llama、Mistral 等
可私有化部署 推理成本转成你的 GPU;安全对齐需自己做 Hugging Face Models

结构意识

「最强」通常只在某个榜、某个任务上成立。生产选型顺序建议: 任务类型 → 数据是否出境 → 延迟成本 → 榜单粗筛 → 自有样例精测。

D. 专题:GPT‑5.6 的 Sol · Terra · Luna

同一代三个档:Sol 最强、Terra 日常、Luna 又快又省——选档比死磕「最新」更重要。

  • 数字(5.6)= 世代;名字(Sol/Terra/Luna)= 能力与成本档位。
  • 难题/高质量 → Sol;默认干活 → Terra;海量轻任务 → Luna。
  • 三档都仍有知识截止与幻觉边界,不是物理世界自动免检。
展开:分档细节与对照其他厂商

OpenAI 将分档设计为可独立演进的 tier。其他厂商亦有旗舰/均衡/轻量命名(如 Claude 的 Opus/Sonnet 等,以官网当前产品线为准)。生产环境建议做「任务路由」:按难度与成本自动选档,并用自有样例回归,而不是全局锁定最贵模型。

旗舰/均衡/快省三档模型示意
命名逻辑(OpenAI 公开表述) 数字表示代数;Sol / Terra / Luna 表示旗舰、均衡、快省档位。

☀ Sol

定位:家族内最强档,适合复杂推理、难编程、高质量长任务。
边界:更贵;仍有截止与幻觉风险;不是物理世界自动执行保证。

🌍 Terra

定位:均衡档,日常主力常见选择,性价比取向。
边界:极端难题可能弱于 Sol;需用任务分流。

🌙 Luna

定位:更快、更省,适合高频简单任务、分类、草稿、低延迟接口。
边界:能力上限最低;别拿它扛关键决策与硬核推理。

和你怎么用

默认 Terra 或中档;卡住再升 Sol;批量轻任务用 Luna。API 路由比「全程旗舰」更专业。

其他厂商也有类似「旗舰 / 均衡 / 轻量」分档(名称不同)。学会分档思维,比记住某一个花名更重要。

E. 权威排行榜与评测(可跳转)

榜单是「粗筛工具」,不是真理。建议至少交叉看: 人类偏好对战 + 代码/Agent 专项 + 开放权重榜。

读榜防坑

  • 榜一会变:版本、采样、是否「thinking/扩展推理」标签要看清。
  • 聊天 Elo 高 ≠ 你的领域文档问答高。
  • 开源榜高 ≠ 商用 API 同款行为(对齐与系统提示不同)。
  • 最终以你的 20–50 条真实题回归测试为准。

F. 和你有什么关系 · 你可以怎么用

个人学习

用中档模型日常学;难题换旗舰;对事实类答案要求来源或自己检索核对。

工作交付

对外材料、合同要点、数据结论:AI 出草稿 + 人终审。禁止「盲信旗舰」。

产品 / 研发

做模型路由与护栏:简单→便宜快;难→旗舰;敏感→人在回路。接 RAG/工具补截止与幻觉。

推荐决策顺序

  1. 任务属于哪类?(写文 / 代码 / 检索问答 / 多步 Agent / 多模态)
  2. 失败代价?(低→可自动;高→必须人审)
  3. 是否需要最新信息?(要→联网或 RAG)
  4. 用榜单缩小到 2–3 个候选
  5. 用自有样例 + 成本延迟复测
  6. 上线后持续抽检(Eval)

与前几页的拼图:边界解释了为什么需要 RAG、 Loop 护栏、 评测 与 具身安全/ODD。

G. 延伸阅读:论文 · 开源 · 官方

排行与模型名更新极快:本页给出入口链接与读法;具体名次请以你打开当天的榜单页面为准。

打开权威榜单区 对照:评测与护栏 对照:框架选型