Skip to content

大语言模型

Concept

大语言模型(LLM)是一种基于 Transformer 架构的深度神经网络,包含数百亿参数并在海量文本上训练而成。

Official Site
01

什么是 LLM

大语言模型(LLM)是由包含数百亿甚至数千亿参数的深度神经网络构建的语言模型。基于 Transformer 架构,通过在海量无标注文本数据上进行自监督学习训练而成,具备强大的自然语言理解与生成能力。简单来说,LLM 在阅读了互联网上的海量文本后,学会了"预测下一个词"——而从这个看似简单的能力中,涌现出了推理、翻译、写代码、对话等复杂智能。

代表模型:GPT-4/5(OpenAI)、Claude(Anthropic)、Gemini(Google)、DeepSeek、Llama(Meta)。

02

Transformer 架构

Transformer 是 Google 于 2017 年提出的架构,是所有现代 LLM 的基石。其核心是"自注意力机制"——在处理一个词时,模型能同时关注句子中所有其他词并理解它们的关系。相比早期只能从左到右顺序读取的 RNN/LSTM 模型,Transformer 能并行处理并捕捉长距离依赖,这是它能"理解上下文"的根本原因。

bash
# Core idea of Transformer (simplified)
# Self-attention: every word "looks at" all other words and computes association weights
attention("bank") = 0.7 * river + 0.3 * money  # disambiguate meaning from context

# Training objective: predict the next word
Input: "The weather today is really"
Target: predict "nice"

# Parameter scale determines capability
GPT-3:  175 billion parameters
GPT-4:  ~1.8 trillion parameters (MoE architecture)
03

参数与训练

LLM 的"大"体现在参数量上:从早期模型的数亿参数,到 GPT-3 的 1750 亿,再到 GPT-4 的万亿级别。参数是模型在训练中学习到的"知识权重"。训练分两个阶段:预训练(从海量文本中学习通用语言能力)+ 微调(用指令数据对齐人类意图,如 RLHF)。参数越多、数据越广,涌现的能力就越强——这被称为"涌现能力"。

训练成本极高:GPT-4 训练花费超过 1 亿美元,需要数千块 GPU 运行数月。

04

开发者如何使用 LLM

开发者使用 LLM 有三种方式:1)调用云端 API(OpenAI/Anthropic/DeepSeek)——上手最快,按量付费;2)自托管开源模型(Llama、Qwen、DeepSeek)——数据留在本地,可控;3)针对垂直场景微调开源模型。在 AI 编码工具中,LLM 是 Agent 的"大脑",工具调用(Function Calling / MCP)是它的"手脚"。

bash
# 1. Call a cloud API (Python example)
from anthropic import Anthropic
client = Anthropic()
response = client.messages.create(
    model="claude-sonnet-4-5",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Write a quicksort in Python"}]
)

# 2. Self-host an open-source model
# Install Ollama → ollama pull deepseek-r1 → ollama run deepseek-r1

# 3. Connect via tools like Continue/Aider—no code needed

选型建议:通用任务用 Claude/GPT;成本敏感用 DeepSeek;隐私敏感用本地 Ollama。

Ready to try 大语言模型?

Visit the official site for the latest version and full documentation.

Visit 大语言模型