ADK.wang AI & 软件技术百科
全库汇聚全球 22,000+ 核心技术词条,深度引证上千本行业权威学术专著,涵盖大模型原理、云原生、架构设计与工程效能。
22,077
全量学术技术词条
9 大
核心专业领域体系
10,000+
权威专著深度引证
100%
原书精粹与工业对齐
专业技术领域分类
共 70 篇词条神经语言模型
Neural Language Model
神经语言模型是一种基于深度神经网络的自然语言处理架构,通过词嵌入将离散词汇映射至低维稠密向量空间,利用循环或自注意力机制捕捉长距离上下文依赖,以突破传统统计模型的参数限制。
规模定律
Scaling Law
规模定律是大模型领域的核心经验法则,指出模型性能随数据量、参数量及算力规模呈幂律增长,是通用人工智能涌现的关键路径。
語言處理 (NLP)
语言处理是人工智能与大模型领域的核心基础技术,指利用算法对自然语言进行理解、生成、转换及分析,赋予机器处理人类语言信息的能力。
长短时记忆 (LSTM)
长短期记忆(LSTM)是一种专为解决传统循环神经网络梯度消失问题而设计的特殊时间序列模型,通过门控机制实现长距离依赖信息的精准捕捉与高效传递。
頭注意力機制
Multi-Head Attention
Multi-Head Attention 是一种将多头注意力机制并行应用于序列数据的深度学习架构,通过多个独立的注意力头同时捕捉不同层面的特征表示,显著提升了 Transformer 模型在语言理解与生成任务中的表现。
Transformer Engine (TE)
Transformer Engine 是专为高性能大模型推理设计的底层计算引擎,通过融合多模态注意力机制与高效算子优化,实现序列处理任务在 GPU/NPU 上的极致加速。
大语言模型智能体
LLM-based Agent
大语言模型智能体是一种基于大语言模型作为核心认知引擎,通过感知、规划、行动循环自主完成复杂任务,并具备工具调用与环境交互能力的智能系统。
Anthropic Large Language Model (LLM)
Anthropic Large Language Model 是由 Anthropic 公司研发的一系列基于 Transformer 架构的通用人工智能模型,旨在提供安全、可靠且可解释的对话与任务处理能力。
Feedforward Neural Networks (FNN)
前馈神经网络是一种无循环连接、信息单向流动的基础深度学习架构,通过多层非线性变换将输入映射为输出,是构建复杂模型(如 Transformer)的核心功能模块。
Head Attention (MLA)
Head Attention 是 Transformer 架构中多头注意力机制(Multi-Head Attention)的核心执行单元,通过并行计算多个独立的注意力向量头,从不同表征维度捕捉输入序列间的复杂依赖关系。
Masked Lanauge Model (MLM)
Masked Language Model 是一种通过随机遮蔽部分输入词元并强制模型预测其内容的预训练范式,旨在通过自监督学习构建强大的语言理解与生成能力。
Multifaceted Transformers (DMT)
Multifaceted Transformers 并非当前主流人工智能技术,现有公开资料中该术语主要关联澳大利亚广播节目《Sunrise》,在 AI 与大模型领域无实质技术定义或架构实现。
Robotics Transformers (RT)
Robotics Transformers 是一种将大语言模型(LLM)的通用推理能力与机器人感知 - 决策 - 控制闭环深度融合的架构范式,旨在解决机器人复杂环境下的自主导航、灵巧操作及多模态交互难题。
Universal Sentence Encoder (USE)
Universal Sentence Encoder 是 Google 推出的基于 Transformer 架构的预训练模型,旨在将任意自然语言句子编码为固定长度的稠密向量,实现跨语言、跨领域的语义理解与检索。
Vision Transformer (VIT)
Vision Transformer 是一种将 Transformer 架构成功迁移至计算机视觉领域的深度学习模型,通过自注意力机制高效处理图像数据,实现了超越传统 CNN 的精度与灵活性。
中间层添加辅助损失
Auxiliary Loss
中间层添加辅助损失是一种在深度学习模型(如Transformer)的编码器-解码器架构中,于中间层引入额外损失函数的技术,旨在通过梯度传播优化深层特征表示,提升模型收敛速度与最终性能。
分组查询注意力 (GQA)
分组查询注意力(GQA)是一种将多头注意力机制中的查询头分组共享键值对的混合架构,旨在平衡大模型推理效率与精度,已成为现代大语言模型事实上的标准组件。
即大语言模型 (LLM)
即大语言模型并非标准技术术语,而是对‘即梦 AI'等特定国产大模型产品的误称或口语化指代,其本质为基于 Transformer 架构的生成式人工智能系统。
变换模型
Transformer
Transformer 是一种基于自注意力机制的深度学习架构,通过并行计算与位置编码实现序列数据的长距离依赖建模,已成为大语言模型及多模态 AI 系统的核心基座。
句子嵌入模型
Sentence Transformers
Sentence Transformers 是一种基于预训练语言模型(如 BERT)的句向量生成框架,通过对比学习将句子映射为固定长度稠密向量,实现高效的语义相似度计算与检索任务。
屏蔽词元
Masked Token
屏蔽词元(Masked Token)是大语言模型预训练中的核心机制,通过用特殊标记替换输入序列中的部分词元,迫使模型学习上下文依赖与语言生成能力,是 Transformer 架构实现自监督学习的基石。
序列分类模块
BertFo- SequenceClassification
BertFo-SequenceClassification 是基于 BERT 预训练模型构建的序列分类模块,专为处理长文本序列的语义理解与分类任务设计,通过融合 Transformer 架构实现高精度文本分析。
序列建模问题 (NLP)
序列建模问题指将具有内在顺序依赖的离散或连续数据流转化为数学函数或神经网络输入,以捕捉时间/空间演化规律并实现预测、生成或分类的核心计算范式。
应用旋转位置嵌入
RoPE
RoPE(旋转位置嵌入)是一种将位置编码与查询/键向量进行旋转乘积的机制,通过参数化方式将相对位置信息注入Transformer模型,显著提升长序列建模能力与训练稳定性。