ADK.wang AI & 软件技术百科
全库汇聚全球 22,000+ 核心技术词条,深度引证上千本行业权威学术专著,涵盖大模型原理、云原生、架构设计与工程效能。
22,077
全量学术技术词条
9 大
核心专业领域体系
10,000+
权威专著深度引证
100%
原书精粹与工业对齐
专业技术领域分类
共 11 篇词条监督微调
Supervised Fine-tuning
监督微调是一种利用高质量标注数据对预训练大模型进行参数更新的技术,旨在通过强化特定任务表现来消除模型幻觉并提升推理准确性。
人工强化学习反馈 (RLHF)
人工强化学习反馈(RLHF)是一种通过人类偏好数据对齐大模型输出的关键技术,旨在将人类价值观注入模型决策,使其生成更符合人类意图、安全且高质量的内容。
微调系统
Fine-Tuning
微调系统是一种基于预训练大模型,通过在小规模特定数据集上注入领域知识或任务逻辑,使通用模型快速适应垂直应用场景的智能化工程化框架。
大白话大模型微调
Fine-tuning
Fine-tuning 是一种通过在小规模标注数据上对预训练大模型进行参数更新,使其适应特定任务或领域知识的深度学习技术。
传统微调
Fine-Tuning
传统微调是通过在预训练大模型基础上,使用特定领域数据重新训练参数以适配下游任务的标准机器学习范式,是构建垂直领域 AI 应用的基础技术路径。
全参数微调
Full Fine-Tuning
全参数微调是一种对预训练大模型所有权重进行端到端更新的优化策略,通过最大化利用有标签数据,在特定任务上实现性能跃升,但面临高昂的计算与存储资源挑战。
加微调
Fine-tuning
Fine-tuning 是在预训练大模型基础上,利用特定领域数据进行参数微调,使其适应下游任务的高效训练范式。
型微调
Fine-tuning
Fine-tuning(微调)是一种通过在小规模数据集上对预训练大模型参数进行梯度更新,使其适应特定任务或领域需求的高效机器学习技术。
大模型做全量参数微调
Full Fine-Tuning
全量参数微调指对大模型所有参数进行端到端更新的技术,通过完整梯度传播实现模型结构与知识的深度重构,适用于小样本场景下的精准适配。
来看看监督微调 (SFT)
监督微调(Supervised Fine-Tuning, SFT)是通过对大模型进行有标签的高质量指令微调,使其从通用语言模型转变为具备特定任务执行能力的智能代理的关键技术。
配合监督微调 (SFT)
配合监督微调(CoT Supervised Fine-Tuning)是一种针对大语言模型引入思维链(Chain-of-Thought)数据的监督微调范式,旨在通过显式训练模型生成分步推理过程,显著提升其在数学、逻辑及复杂任务中的推理能力与准确性。