Day1 AI核心基础概念学习笔记

零基础入门必懂三概念|超级简单版


一、今日学习目标

  1. 搞懂 Token 是什么(AI 的最小文字单位)

  2. 理解 上下文窗口是什么(AI 的记忆力上限)

  3. 明白 上下文截断是什么(防止超限的核心手段)

  4. 学会用在线工具统计 Token 数量


二、Token 是什么(AI 的最小单位)

大白话解释

Token = AI 世界里的 “最小文字单位”
AI 本身不认识汉字、英文单词,它只认识 Token,所有的文字、符号、空格,都会被转换成 Token 来处理。

简单换算规律

  • 1 个中文汉字 ≈ 1 个 Token

  • 1 个英文单词 ≈ 1 个 Token

  • 标点、符号、空格、代码 都算独立的 Token

举例

  • 文字:你好,AI → 约 4 个 Token

  • 文字:Hello World → 约 2 个 Token


三、上下文窗口是什么

大白话解释

上下文窗口 = AI 的 “短期记忆力上限”
它代表 AI 一次最多能处理、能记住的最大 Token 数量,超过这个数量,AI 就处理不了了。

形象比喻

  • 上下文窗口 = 一个固定大小的箱子

  • Token = 要放进箱子的物品

  • 箱子大小是固定的,装不下就会溢出报错

真实模型例子

DeepSeek 普通模型的上下文窗口是 128K,意思是:

一次最多能处理 128000 个 Token,大概相当于 9.6 万字的内容。


四、上下文截断是什么

大白话解释

上下文截断 = 箱子满了,主动扔掉最旧的东西

为什么要做截断?

聊天越久,历史消息越多,Token 就会越来越多,一旦超过上下文窗口,AI 接口就会直接报错,所以必须主动删除没用的老历史,保证总 Token 不超限。

企业通用截断规则

  1. 永远保留 system 人设消息:AI 的角色设定不能丢

  2. 保留最新的对话:最近的聊天内容才是当前有用的

  3. 成对删除最旧的对话:user 和 assistant 的消息要一起删,保证对话结构完整


五、在线工具:统计 Token 数量

工具作用

把文字粘贴进去,就能自动算出这段文字用了多少 Token,帮你提前判断会不会超限。

常用工具

  1. OpenAI 官方 Tokenizer(最通用、最准确):https://platform.openai.com/tokenizer

  2. DeepSeek Token 计算器:适配 DeepSeek 模型的统计工具

  3. 百度搜索:Token统计工具 也能找到很多在线工具

使用方法

  1. 打开工具网站

  2. 把要统计的文字粘贴进去

  3. 立刻就能看到总 Token 数量


六、Day1 核心知识点总结(必背三句话)

  1. Token = AI 的最小文字单位,所有内容都会转成 Token 处理

  2. 上下文窗口 = AI 的短期记忆力上限,超过就会报错

  3. 上下文截断 = 为了不超限,主动删除最旧的历史消息


七、注意事项

  1. 不要让对话的总 Token 超过模型的上下文窗口,否则接口会直接报错

  2. 统计 Token 优先用官方工具,结果最准确

  3. 截断只会删最旧的历史,不会影响你当前的对话内容


最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容