大模型核心名词手册(完整版,分层整理,零基础可查)
目录一、基础通用概念二、模型训练全流程名词1. 预训练 Pretrain2. 微调 Fine-tune3. 训练配套名词三、推理 部署工程名词四、提示词 应用生态名词五、模型核心架构名词Transformer 体系六、评测、对齐与安全名词七、开源 主流模型系列名词八、行业衍生名词一、基础通用概念大语言模型 LLMLarge Language Model基于 Transformer 架构、海量文本数据训练能理解、生成人类自然语言的巨型神经网络核心是预测下一个文字。生成式 AIGenerative AIAI 自主创造全新内容文字、图片、音频、视频、代码区别于判别式 AI只做分类、识别。基础大模型Base Model / 基座模型仅用海量互联网文本预训练、未做指令对齐、无对话人设的原始大模型输出不可控、不适合直接聊天。对话大模型Chat Model基座模型经过微调、人类反馈优化适配问答、多轮对话场景如 ChatGPT、文心一言、通义千问。多模态大模型Multimodal LLM同时处理文本、图片、音频、视频、3D 等多种信号输入输出代表GPT-4V、Qwen-VL、Gemini。参数Parameter模型神经网络里可学习的权重数值单位 B十亿参数规模越大理论理解能力越强训练推理成本越高。权重Weights模型训练后保存的数值文件存储所有知识与逻辑是模型的 “记忆本体”。Token词元大模型最小计算单位文字会被切分为 token中文 1 汉字≈1.5~2token1token≈0.75 个汉字。上下文窗口 Context Window模型单次能读取、记忆的总 token 上限包含历史对话 当前提问窗口越大长文档处理能力越强。上下文长度 / 上下文扩容原生窗口较小的模型通过算法扩展可读取文本长度如 8K 扩至 32K、128K。嵌入 Embedding把文字、图片转为低维数字向量用于语义检索、知识库匹配、相似度计算。二、模型训练全流程名词1. 预训练 Pretrain预训练阶段第一阶段训练用全网通用无标注文本学习语法、常识、世界知识搭建基础语言能力。预训练数据书籍、网页、论文、代码等无标签原始语料数据规模、干净度直接决定基座上限。预训练损失标准自回归损失目标最大化文本出现概率。2. 微调 Fine-tune对已预训练基座做小规模数据二次训练分多种类型SFT 有监督微调Supervised Fine-Tuning人工标注高质量问答 / 对话数据教会模型遵循人类指令是对话模型必备步骤。RLHF 基于人类反馈的强化学习三段式优化SFT→奖励模型训练→强化学习 PPO让输出贴合人类偏好、价值观、安全规范。RLAIF AI 反馈强化学习用大模型替代人工打分生成奖励信号降低人工标注成本。LoRA 低秩自适应微调轻量化微调方案冻结主模型权重仅训练极小附加矩阵显存占用极低、适配本地部署。全参数微调 Full FT更新模型全部权重效果上限最高但算力、显存成本巨大。Prefix Tuning / Prompt Tuning冻结主模型仅训练少量前缀参数 / 软提示极轻量化微调方案。3. 训练配套名词算力卡GPU/TPU/NPU显卡 / 专用 AI 芯片负责模型训练、推理计算A100、H100、昇腾 910B 为主流。集群训练多 GPU 多机器分布式并行训练超大模型。语料清洗过滤色情、暴力、重复、低质、版权违规文本提升模型安全性与效果。数据去重剔除重复文本避免模型过拟合、记忆重复内容。分词器 Tokenizer负责把文字转 token、token 转回文字模型配套专属工具。Epoch 训练轮次完整跑完一遍全部训练数据为 1 轮多轮易过拟合。Batch 批次单次送入模型计算的数据条数越大训练速度越快、显存占用越高。学习率 Learning Rate权重更新幅度大模型训练用极小学习率。过拟合 Overfit模型死记训练数据陌生新问题表现大幅下滑。欠拟合 Underfit训练不足基础能力差训练集效果也很差。三、推理 部署工程名词推理 Inference模型训练完成后接收用户输入、生成回答的运行过程即线上服务阶段。推理速度 Tokens/s每秒生成 token 数量衡量接口、本地模型响应快慢。量化 Quantization压缩模型权重精度FP16→INT8/INT4/GGUF大幅降低显存占用、提速轻微损失效果。FP3232 位浮点数原始高精度FP16/BF16半精度主流训练格式INT8/INT4低比特量化本地部署常用GGUF / GGMLllama.cpp 开源轻量化模型存储格式专门适配 CPU 本地离线运行。KV 缓存 KV Cache推理加速核心技术缓存历史对话的注意力矩阵避免重复计算大幅提升长对话速度。流式输出 Stream逐字逐 token 实时返回回答前端打字机效果非流式为完整生成后一次性返回。API 应用程序接口厂商开放模型调用接口输入文本返回生成结果企业开发通用方式。私有化部署模型部署在企业本地服务器 / 私有云数据不出内网满足数据安全合规。本地离线部署电脑 / 单机显卡加载模型无需联网、不调用第三方 API。分布式推理超大模型拆分至多块显卡并行运行单卡无法承载时使用。负载均衡多台推理服务器分摊用户请求防止单机器过载。熔断限流请求量过高时限制访问保障服务稳定不崩溃。四、提示词 应用生态名词Prompt 提示词给大模型的输入指令包含问题、角色、格式、约束直接决定输出质量。System Prompt 系统提示词全局角色设定对话全程生效定义模型身份、规则、输出规范。Few-shot 少样本提示Prompt 中附带 2~5 个示例引导模型模仿固定格式输出。Zero-shot 零样本不给示例仅靠文字指令让模型完成任务。CoT 思维链Chain of Thought提示词引导模型分步推理先拆解逻辑再给答案数学、逻辑题效果显著提升。RAG 检索增强生成Retrieval-Augmented Generation核心落地架构先从私有知识库检索真实资料再把资料塞进 Prompt 给大模型回答解决幻觉、知识过时问题。知识库企业文档、PDF、数据库、本地资料集合向量库存储文本 Embedding 向量的数据库Chroma、Milvus、FAISS文本分块 Chunk长文档切割成小段用于向量检索Agent 智能体具备自主规划、工具调用、多步骤任务执行能力的大模型应用能联网、查数据库、调用代码、操作工具。工具调用 Tool Calling模型自主识别需求调用插件 / 外部接口规划 Planning复杂任务拆分为多步执行记忆 MemoryAgent 长期存储历史任务信息Function Calling 函数调用模型输出结构化 JSON 指令自动调用自定义工具、接口。插件 Plugin给大模型扩展外部能力联网搜索、计算、表格处理。微调数据集专门用于 SFT/RLHF 的标注问答对分通用、行业垂直两类。垂直行业大模型在通用基座基础上用行业专业数据微调适配医疗、法律、工业、金融等细分场景。五、模型核心架构名词Transformer 体系Transformer当前所有大模型统一基础架构2017 谷歌提出依靠自注意力机制实现长文本理解。自注意力 Self-Attention核心机制让文字之间互相计算关联权重理解上下文语义关系。多头注意力 Multi-Head Attention拆分多组注意力并行计算同时捕捉语法、逻辑、指代多种语义关系。编码器 Encoder双向注意力同时看前文后文多用于翻译、分类、嵌入模型BERT。解码器 Decoder单向自回归注意力只能读取上文、逐字生成下文LLM 主流架构GPT、Llama。Encoder-Decoder 架构编解码组合适合翻译、摘要T5、BART。层归一化 Layer Norm稳定训练数值分布解决深层网络梯度消失。前馈网络 FFN每层注意力后的非线性转换模块存储大部分知识。位置编码 Positional Encoding给 token 注入文字顺序信息Transformer 本身无时序感知能力。自回归生成 Autoregressive当前只依据上文预测下一个 token主流 LLM 生成逻辑。六、评测、对齐与安全名词对齐 Alignment通过 SFT、RLHF 让模型输出符合人类价值观、指令、安全规范分为能力对齐、价值对齐。幻觉 Hallucination模型编造不存在事实、虚假数据、文献RAG 是主流抑制方案。基准评测 Benchmark标准化试题集量化模型能力MMLU综合知识、GSM8K数学、HumanEval代码、C-Eval中文综合。困惑度 Perplexity PPL衡量模型文本流畅度数值越低语言逻辑越通顺。有害输出生成暴力、色情、谣言、歧视、违法内容依靠安全对齐、内容审核拦截。越狱 Prompt Jailbreak恶意提示词绕过安全限制诱导模型输出违规内容。可解释性 XAI分析模型注意力权重、激活值看懂模型判断逻辑。鲁棒性 Robustness输入错别字、混乱语句、恶意诱导时模型稳定不跑偏的能力。偏见 Bias训练数据自带性别、地域、职业刻板印象导致输出不公平结论。数据泄露训练语料包含隐私、用户原始数据模型会复述隐私信息。七、开源 主流模型系列名词LlamaMeta 开源基座系列全球最通用商用 / 本地模型Llama2、Llama3Qwen 通义千问阿里开源全系列多模态、长短上下文全覆盖GLM智谱 AI 开源模型GLM3/GLM4支持超长上下文Mistral欧洲轻量化高效模型小参数对标大模型效果GPTOpenAI 闭源系列GPT-3.5、GPT-4、GPT-4V 多模态GeminiGoogle 多模态原生大模型RWKV非 Transformer 架构纯 RNN极低显存占用llama.cpp开源本地推理框架支持 CPU/GPU 量化离线运行八、行业衍生名词AIGCAI 生成内容大模型落地应用统称MLOpsAI 模型全生命周期运维训练、评测、部署、监控迭代算力租赁按需租用 GPU 显卡用于训练 / 本地推理知识库问答基于 RAG 的企业落地场景数字人多模态大模型驱动虚拟形象语音、视频对话代码大模型 Code LLM专门优化代码生成、调试、解释CodeLlama、StarCoderAgent 智能体平台可视化搭建自动化 AI 任务流程模型蒸馏 Distillation用大模型输出训练小型模型小模型低成本复刻大模型能力

相关新闻

Cesium for Unreal 3D地球开发:从插件安装到性能优化的完整指南

Cesium for Unreal 3D地球开发:从插件安装到性能优化的完整指南

1. 项目概述:为什么选择Cesium for Unreal来构建3D地球?如果你刚接触UE4,想做一个带真实地理坐标的3D地球场景,比如做个城市规划的演示、飞行模拟器,或者就是单纯想看看自己家房子在三维地图里长啥样,那你大…

2026/7/21 18:28:18 阅读更多 →
OpenClaw技术架构解析:本地化AI助手与模块化设计

OpenClaw技术架构解析:本地化AI助手与模块化设计

1. OpenClaw技术架构解析:从开源助手到个人AI操作系统OpenClaw本质上是一个运行在用户本地的开源AI助手框架,其核心设计理念是将大型语言模型(LLM)与可扩展的技能系统相结合。与云端AI服务不同,OpenClaw采用去中心化架构,所有数据…

2026/7/21 18:28:19 阅读更多 →
Visual C++运行时终极解决方案:告别DLL缺失错误的完整指南

Visual C++运行时终极解决方案:告别DLL缺失错误的完整指南

Visual C运行时终极解决方案:告别DLL缺失错误的完整指南 【免费下载链接】vcredist AIO Repack for latest Microsoft Visual C Redistributable Runtimes 项目地址: https://gitcode.com/gh_mirrors/vc/vcredist 你是否在打开某些软件时,频繁遇到…

2026/7/21 18:28:19 阅读更多 →

最新新闻

【EU thetis_MRV网站之额外篇-Ice Class】

【EU thetis_MRV网站之额外篇-Ice Class】

Ice Class 目录 Ice Class 前言 一、EU ETS 1、法规 Regulations 2、计算公式 Calculation formula 二、FuelEU 1、法规 Regulations 2、附件 ANNEX 3、计算公式 Calculation formula 4、温室气体实际值 GHGIEactual 三、差异对比 总结 前言 thetis网站之额外篇Ice…

2026/7/21 23:40:10 阅读更多 →
羽毛球智能训练系统:从手工标注到 AI 多模态分析的创业技术复盘

羽毛球智能训练系统:从手工标注到 AI 多模态分析的创业技术复盘

羽毛球智能训练系统:从手工标注到 AI 多模态分析的创业技术复盘 一、从一筐录像带到第一条数据流水线 业余羽毛球训练中的普遍痛点:学员在场上挥汗如雨,教练在场边喊得声嘶力竭,但课后学员往往只记得"反手要多练"这种模…

2026/7/21 23:40:10 阅读更多 →
邮箱表白纪念日源码

邮箱表白纪念日源码

简介: 邮箱表白纪念日源码 访问 http://你的域名/install.php 进行安装 源码下载:https://download.csdn.net/download/m0_66047725/93058733 图片:

2026/7/21 23:40:10 阅读更多 →
大模型推理服务化复盘:从40% GPU利用率到92%的调优全链路

大模型推理服务化复盘:从40% GPU利用率到92%的调优全链路

大模型推理服务化复盘:从40% GPU利用率到92%的调优全链路 一、推理服务的“隐性成本”困境:GPU 空转比慢响应更致命 在团队将首个大模型推理服务推向生产环境后,监控面板上的数据并不令人满意:峰值 QPS 约 120,P99 延…

2026/7/21 23:40:10 阅读更多 →
AI云原生实战05-金融AI上云最难的不是技术,是“不出事“——TCE银行风控架构拆解

AI云原生实战05-金融AI上云最难的不是技术,是“不出事“——TCE银行风控架构拆解

💡 本文是《AI云原生实战调研》系列第五篇。上一篇我们聊了GPU调度的MIGTime Slicing方案,这一篇我们走进金融行业——一个把"稳"字刻进骨髓、出一次事故就可能上315的领域。 目录 目录 目录 开篇:那个差点上315的凌晨 一、金融…

2026/7/21 23:40:10 阅读更多 →
AgentScope Java 2.0 GA 正式发布,打造企业级 Harness 底层架构

AgentScope Java 2.0 GA 正式发布,打造企业级 Harness 底层架构

模型能力在趋同,Agent 框架也在趋同。真正拉开差距的,是框架把"长期运行一个 Agent 所需的工程能力"内置到什么程度。 AgentScope Java 2.0 的答案:ReActAgent 推理内核不动,在其上长出一整套 Harness 工程化层&#xf…

2026/7/21 23:39:10 阅读更多 →

日新闻

Octane Render与C4D汉化版安装与优化指南

Octane Render与C4D汉化版安装与优化指南

1. Octane Render与C4D的黄金组合:为什么选择这个方案?在三维创作领域,渲染器的选择往往决定了作品的最终呈现质量和工作效率。作为Cinema 4D(C4D)用户,Octane Render的GPU加速特性与实时预览功能&#xff…

2026/7/21 0:00:19 阅读更多 →
GPMC接口设计:异步/同步模式与多路复用配置实战

GPMC接口设计:异步/同步模式与多路复用配置实战

1. GPMC接口设计:从硬件连接到软件配置的全局视角在嵌入式系统开发中,尤其是基于TI Sitara系列如AM263x这类高性能微控制器的项目里,外部存储器的扩展几乎是绕不开的一环。无论是存放大量非易失性代码的NOR Flash,还是作为高速数据…

2026/7/21 0:00:19 阅读更多 →
UE5 GAS框架下RPG被动技能系统:从核心原理到实战实现

UE5 GAS框架下RPG被动技能系统:从核心原理到实战实现

1. 项目概述:UE5 GAS RPG被动技能的核心价值在UE5里用GAS(Gameplay Ability System)做RPG游戏,主动技能像是你手里的武器,按一下打一下,逻辑直接,反馈也快。但被动技能,它更像是你身…

2026/7/21 0:00:19 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/21 8:48:31 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 5:34:47 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 8:25:39 阅读更多 →

月新闻