词元
词条信息
外文名:Token 标准定名:全国科学技术名词审定委员会 2026 年 3 月正式发布人工智能领域标准中文译名 所属学科:计算语言学、自然语言处理、人工智能、计算机科学、理论语言学 别名:标记、令牌(计算机通用旧译)
摘要
词元(英文:Token)是文本经分词、子词切分、字节编码后得到的最小离散处理单元,为自然语言处理、大语言模型、编译器词法分析的基础核心术语。2026 年 3 月,全国科学技术名词审定委员会、国家数据局统一将 AI 领域 Token 规范译名为 “词元”,终结此前标记、令牌、符元等多种译法混用的乱象。词元不等于汉字、词语,可由完整词汇、词根词缀、子词、单字符、字节片段构成,是大模型读取、计算文本语义的基础载体;该概念同时跨语言学、编译原理、区块链多领域,在不同场景下定义存在区分。
一、术语定名与词源
1.1 词源溯源
英文 Token 源自古英语tācen,本义为符号、信物、标识,1960 年代引入计算机编译领域,用于指代源代码不可拆分的语法单元;20 世纪末拓展至语料库语言学,2020 年后伴随大语言模型普及成为 AI 核心高频术语。
1.2 中文定名过程
大模型普及初期,行业对 Token 译法混乱,存在令牌、标记、符号、符元等十余种译法,不利于技术标准统一。2026 年 3 月 23 日,国家数据局在中国发展高层论坛 2026 年会官宣,人工智能领域 Token 标准中文名称为词元;同月全国科学技术名词审定委员会发布官方术语公告,面向全行业推广使用该定名,“词” 对应语言文本属性,“元” 代表最小基础单元,兼顾语义与技术内涵。
二、分领域定义
2.1 自然语言处理 / 大模型(核心释义)
词元是人类文本经分词器(Tokenizer)切割、编码后,大语言模型能够独立识别、向量映射、运算的最小语义离散单元。
- 与汉字、词语的区别
- 英文:高频完整单词独立为词元;低频长词拆分为子词词元(如 unhappiness 拆为 un、happiness);单字母、标点、数字单独成词元。
- 中文:无天然空格分隔,多采用子词、字符混合切分,一个汉字、双字词、常用成语均可单独作为词元,单字、偏旁片段也会被切分。
- 边界:词元无固定字数限制,仅由模型预训练分词词典决定,1 词元≠1 个字。
- 核心作用 人类文字无法直接输入神经网络,需全部转换为词元序列,再映射为嵌入向量,是模型理解上下文、生成文本、计算上下文窗口的基础;同时词元数量是衡量模型输入长度、计费、算力消耗的通用度量单位。
2.2 理论语言学(语料库方向)
在语言学二分概念Type-Token体系中,词元(Token)指语料中每一次实际出现的语言实例;Type 指不重复的词汇类型。 示例:句子 “苹果很好吃,苹果很甜”,Type 数量为 4(苹果、很、好吃、甜),Token(词元)数量为 6,两次出现的 “苹果” 计两个独立词元。
2.3 计算机编译原理
编译器词法分析阶段,源代码字符流拆分出的基础语法单元统称词元(旧称令牌),包含关键字、变量名、运算符、数字、标点,是语法分析的输入基础,该场景业内仍习惯称 “令牌”。
2.4 区块链 / 密码学(易混淆同形异义)
区块链领域 Token 标准译名为代币,不使用 “词元”;指代链上发行、承载权益、可流通的数字凭证,与 AI 领域词元为同名异义概念,技术场景严格区分译法避免歧义。
三、核心技术流程:词元化(Tokenization)
词元化(分词切分)是生成词元的核心步骤,主流算法分为三类:
- 词级切分:按空格、标点完整拆分单词,仅适用于英文等分词语言,中文不适用;缺陷是词典庞大、无法处理生僻词。
- 字符级切分:将全部文本拆分为单个字符,兼容性强,但词元序列过长、算力损耗高。
- 子词切分(大模型主流):代表算法 BPE、WordPiece、SentencePiece,平衡完整词语与字符,高频词汇完整保留,低频长词、生僻字拆分为子词词元,兼顾效率与语义表达,为 GPT、文心一言、通义千问等主流大模型标配方案。
四、词元的应用场景
- 大语言模型交互:对话、文案生成、翻译、代码编写均以词元为输入输出单位,平台计费、上下文长度限制均按词元统计。
- 文本分析:情感分析、关键词提取、文本分类、检索系统,全部基于词元序列完成语义计算。
- 编译器开发:程序代码词法解析、语法校验。
- 语料库建设:语言学统计词汇频次、文本复杂度,依托 Type-Token 词元统计体系。
五、易混淆概念辨析
- 词元 vs 汉字 / 词语:中文一句 10 个汉字,切分后可能为 6–15 个词元,二者无固定换算关系。
- 词元 vs Type(词型):词元统计出现次数,词型统计不重复词汇,为语言学配套成对概念。
- AI 词元 vs 区块链代币:英文均为 Token,国家术语规范已区分译法,分属人工智能、金融科技两个独立体系,无关联。
- 词元 vs 向量:词元是文本离散符号,向量是词元转换后的数值矩阵,词元是向量映射的前置基础。
六、行业规范与发展意义
- 标准价值:“词元” 统一译名消除跨企业、跨学科沟通障碍,成为国内人工智能教材、技术文档、行业标准强制推荐术语。
- 产业度量标准:词元作为统一计量单位,广泛应用于大模型算力评估、API 调用计费、长文本能力标定,是 AI 产业通用量化标尺。
- 学术普及:统一定名降低大众理解门槛,推动大模型基础原理科普。
参考资料
- 全国科学技术名词审定委员会。人工智能术语公告(2026-03)[EB/OL]. 国家科技名词网,2026.
- 国家数据局。专家解读:从 Token 标准译名 “词元” 说开去 [EB/OL].2026-04.
- 科学网. Token 官方定名词元:术语内涵与技术解析,2026.
- 《计算语言学基础》,高等教育出版社。
- OpenAI、百度文心大模型官方技术文档分词规范说明。