什么是 LLM
大语言模型(LLM)是由包含数百亿甚至数千亿参数的深度神经网络构建的语言模型。基于 Transformer 架构,通过在海量无标注文本数据上进行自监督学习训练而成,具备强大的自然语言理解与生成能力。简单来说,LLM 在阅读了互联网上的海量文本后,学会了"预测下一个词"——而从这个看似简单的能力中,涌现出了推理、翻译、写代码、对话等复杂智能。
代表模型:GPT-4/5(OpenAI)、Claude(Anthropic)、Gemini(Google)、DeepSeek、Llama(Meta)。
Transformer 架构
Transformer 是 Google 于 2017 年提出的架构,是所有现代 LLM 的基石。其核心是"自注意力机制"——在处理一个词时,模型能同时关注句子中所有其他词并理解它们的关系。相比早期只能从左到右顺序读取的 RNN/LSTM 模型,Transformer 能并行处理并捕捉长距离依赖,这是它能"理解上下文"的根本原因。
# Core idea of Transformer (simplified)
# Self-attention: every word "looks at" all other words and computes association weights
attention("bank") = 0.7 * river + 0.3 * money # disambiguate meaning from context
# Training objective: predict the next word
Input: "The weather today is really"
Target: predict "nice"
# Parameter scale determines capability
GPT-3: 175 billion parameters
GPT-4: ~1.8 trillion parameters (MoE architecture)参数与训练
LLM 的"大"体现在参数量上:从早期模型的数亿参数,到 GPT-3 的 1750 亿,再到 GPT-4 的万亿级别。参数是模型在训练中学习到的"知识权重"。训练分两个阶段:预训练(从海量文本中学习通用语言能力)+ 微调(用指令数据对齐人类意图,如 RLHF)。参数越多、数据越广,涌现的能力就越强——这被称为"涌现能力"。
训练成本极高:GPT-4 训练花费超过 1 亿美元,需要数千块 GPU 运行数月。
开发者如何使用 LLM
开发者使用 LLM 有三种方式:1)调用云端 API(OpenAI/Anthropic/DeepSeek)——上手最快,按量付费;2)自托管开源模型(Llama、Qwen、DeepSeek)——数据留在本地,可控;3)针对垂直场景微调开源模型。在 AI 编码工具中,LLM 是 Agent 的"大脑",工具调用(Function Calling / MCP)是它的"手脚"。
# 1. Call a cloud API (Python example)
from anthropic import Anthropic
client = Anthropic()
response = client.messages.create(
model="claude-sonnet-4-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Write a quicksort in Python"}]
)
# 2. Self-host an open-source model
# Install Ollama → ollama pull deepseek-r1 → ollama run deepseek-r1
# 3. Connect via tools like Continue/Aider—no code needed选型建议:通用任务用 Claude/GPT;成本敏感用 DeepSeek;隐私敏感用本地 Ollama。
Ready to try 大语言模型?
Visit the official site for the latest version and full documentation.
Visit 大语言模型