hanghai tian

博客

强化学习

强化学习^1 通过有监督微调,大语言模型已初步具备遵循人类指令并完成多类型任务的能力。然而该方法存在显著局限:首先需要构建海量指令-答案对数据集,高质量回复标注需耗费高昂人力成本;其次交叉熵损失函数要求模型输出与标准答案逐字匹配,既无法适应自然语言的表达多样性,也难以解决输出对输入微小变动的敏感性,这在需要深度推理的复杂任务中尤为突出。 当前大语言模型中的强化学习技术主要沿着两个方向演进:其一是基于人类反馈的强化学习(Reinforcement Learning from Human Feedback,RLHF),通过奖励模型对生成文本进行整体质量评估,使模型能自主探索更优的回复策略,并使得模型回复与人类偏好和价值观对齐。典型如 ChatGPT 等对话系统,通过人类偏好数据训练奖励模型,结合近端策略优化(Proximal Policy Optimization,PPO)算法实现对齐优化。其二是面向深度推理的强化学习框架,以 OpenAI 的 O 系列模型和 DeepSeek的 R 系列为代表,通过答案校验引导模型进行多步推理。这类方法将复杂问题分解为长思维链(Chain-of-
阅读时间 79 分钟
博客

指令微调

指令微调^1 指令微调又称有监督微调,是指在预训练大语言模型的基础上,通过使用有标注的自然语言形式的数据,对模型参数进行微调,使模型具备指令遵循(Instruction Following)能力,能够完成各类预先设计的任务,并可以在零样本情况下处理诸多下游任务。经过海量数据预训练后的语言模型虽然具备了大量的“知识”,但是由于其训练时的目标仅是进行下一个词的预测,因此不能够理解并遵循人类自然语言形式的指令。为了使模型具有理解并响应人类指令的能力,还需要使用指令数据对其进行调整。如何构造指令数据,如何高效低成本地进行指令微调训练,以及如何在语言模型基础上进一步扩大上下文等问题,是大语言模型在指令微调阶段的核心。 本章先介绍大语言模型指令微调训练方法,在此基础上介绍高效模型微调及模型上下文窗口扩展方法,最后介绍指令微调的代码实践。 指令微调训练 指令微调具体训练过程并不复杂,主要分为如下三个步骤:(1)针对每一项任务去明确地定义相应的自然语言形式的指令或者提示,这些指令或提示对任务目标以及输出要求进行清晰描述;(2)把训练数据调整成包含指令以及与之对应的响应的形式;(3)使
阅读时间 68 分钟
博客

分布式训练

分布式训练^1 随着大语言模型参数量和所需训练数据量的急速增长,单个机器上有限的资源已无法满足其训练的要求。需要设计分布式训练系统来解决海量的计算和内存资源需求问题。在分布式训练系统环境下,需要将一个模型训练任务拆分成多个子任务,并将子任务分发给多个计算设备,从而解决资源瓶颈。如何才能利用数万个计算加速芯片的集群,训练千亿甚至万亿参数规模的大语言模型?这其中涉及集群架构、并行策略、模型架构、内存优化、计算优化等一系列的技术。 本章将介绍分布式机器学习系统的基础概念、分布式训练的并行策略、分布式训练的集群架构,并以 DeepSpeed 为例,介绍如何在集群上训练大语言模型。 分布式训练概述 分布式训练(Distributed Training)是指将机器学习或深度学习模型训练任务分解成多个子任务,并在多个计算设备上并行训练。图4.1 给出了单个计算设备和多个计算设备的示例,这里计算设备可以是中央处理器(Central Processing Unit,CPU)、图形处理器(Graphics Processing Unit,GPU)、张量处理器(Tensor Process
阅读时间 60 分钟
博客

大语言模型预训练数据

大语言模型预训练数据^1 在预训练阶段,大语言模型从海量“高质量”文本数据中学习广泛的知识,随后这些知识存储在其模型参数当中。通过预训练使得大语言模型具备了一定程度的语言理解和生成能力。因此,如何构造海量“高质量”数据对于大语言模型预训练具有至关重要的作用。研究表明,预训练数据需要涵盖各种类型的文本,也需要覆盖尽可能多的领域、语言、文化和视角,从而提高大语言模型的泛化能力和适应性。当前大模型预训练使用的语料库涵盖网页内容、学术资料、百科、社交媒体和书籍等文本内容,同时也包含来自不同领域的文本内容,比如法律文件、年度财务报告、医学教科书等其他特定领域的数据。 本章将介绍常见的大语言模型预训练数据的来源、处理方法、预训练数据对大语言模型影响的分析及开源数据集等。 数据来源 文献 [13] 介绍了 OpenAI 训练 GPT-3 使用的主要数据来源,包含经过过滤的 CommonCrawl数据集[19]、WebText 2、Books 1、Books 2 及英文 Wikipedia 等数据集。其中
阅读时间 75 分钟
博客

大模型原理

大模型原理 绪论 大语言模型是一种由包含数百亿个及以上参数的深度神经网络构建的语言模型,通常使用自监督学习方法通过大量无标注文本进行训练。^1 2018 年以来,Google、OpenAI、Meta、百度、华为等公司和研究机构相继发布了 BERT、GPT等多种模型,这些模型在几乎所有自然语言处理任务中都表现出色。2019 年,大语言模型呈现爆发式的增长,特别是 2022 年 11 月 ChatGPT(Chat Generative Pre-trained Transformer)的发布,引起了全世界的广泛关注。用户可以使用自然语言与系统交互,实现问答、分类、摘要、翻译、聊天等从理解到生成的各种任务。大语言模型展现出了强大的对世界知识的掌握和对语言的理解能力。 语言模型(Language Model,LM)的目标就是对自然语言的概率分布建模。词汇表 V 上的语言模型,由函数 P(w1w2 · · · wm) 表示,
阅读时间 76 分钟
博客

大模型汇总

大模型汇总 大模型 LFM2.5^1 2026年1月8号 LFM2.5是Liquid AI在2026年1月发布的新一代小型基础模型家族,专为边缘设备设计,强调高效的多模态处理和离线推理能力。下表概括了其主要模型及特点。 模型名称 参数规模 核心功能/特点 关键性能/应用场景 LFM2.5-1.2B-Instruct 12亿 通用文本模型,擅长指令遵循、知识推理与工具调用,在GPQA和MMLU-Pro等基准测试中领先同类1B级模型 LFM2.5-1.2B-JP 12亿 针对日语任务优化,在JMMLU等日语基准测试中表现优异 LFM2.5-VL-1.6B 16亿 视觉语言模型,集成视觉模块以理解图像;支持文档理解、界面读取和多图像推理 LFM2.5-Audio-1.5B 15亿 音频语言模型,支持文本和音频输入输出;处理速度较前代提升8倍,适用于实时语音对话和识别 💡 模型核心优势 LFM2.
阅读时间 7 分钟
博客

存储汇总

存储汇总 存储系统 CubeFS 总结 CubeFS 是一个开源的云原生分布式文件系统,于2024年成为云原生计算基金会(CNCF)毕业项目。它旨在通过一套存储系统同时支持文件、对象和大数据等多种存储协议,并能灵活适配从高性能计算到海量冷数据归档的多样化场景4。 核心特性 1. 多协议支持 CubeFS 兼容 POSIX(如本地磁盘)、S3(对象存储)、HDFS(大数据)协议,且数据在不同协议间互通4。 2. 双存储引擎 3. 多副本引擎:提供高可用性和低延迟,适用于对性能要求高的场景。 4. 纠删码引擎:具备高可靠性、高可用性、低成本的特点,支持超大规模(EB级别)存储4。 5. 云原生与可扩展性 6. 原生支持多租户隔离和容器存储接口(CSI),易于在 Kubernetes 上部署和运维4。 7. 各模块可水平扩展,轻松构建
阅读时间 3 分钟
博客

分布式存储

分布式存储 分布式存储系统,是将数据分散存储在多台独立的设备上。传统的网络存储系统采用集中的存储服务器存放所有数据,存储服务器成为系统性能的瓶颈,也是可靠性和安全性的焦点,不能满足大规模存储应用的需要。分布式网络存储系统采用可扩展的系统结构,利用多台存储服务器分担存储负荷,利用位置服务器定位存储信息,它不但提高了系统的可靠性、可用性和存取效率,还易于扩展。 分布式存储最早是由谷歌提出的,其目的是通过廉价的服务器来提供使用与大规模,高并发场景下的 Web 访问问题。它 采用可扩展的系统结构,利用多台存储服务器分担存储负荷,利用位置服务器定位存储信息,它不但提高了系统的可靠性、可用性和存取效率,还易于扩展。 分布式存储的兴起与互联网的发展密不可分,互联网公司由于其数据量大而资本积累少,而通常都使用大规模分布式存储系统。 与传统的高端服务器、高端存储器和高端处理器不同的是,互联网公司的分布式存储系统由数量众多的、低成本和高性价比的普通 PC 服务器通过网络连接而成。其主要原因有以下三点 (1) 互联网的业务发展很快,而且注意成本消耗,这就使得存储系统不能依靠传统的纵向扩展
阅读时间 84 分钟
博客

图像清晰度

图像清晰度 图像清晰度是衡量图像质量的一个重要指标,对于相机来说,其一般工作在无参考图像的模式下,所以在拍照时需要进行对焦的控制。对焦不准确,图像就会变得比较模糊不清晰。相机对焦时通过一些清晰度评判指标,控制镜头与CCD的距离,使图像成像清晰。一般对焦时有一个调整的过程,图像从模糊到清晰,再到模糊,确定清晰度峰值,再最终到达最清晰的位置。^1 常见的图像清晰度评价一般都是基于梯度的方法,本文将介几种简单的评价指标,分别是Brenner梯度法、Tenegrad梯度法、laplace梯度法、方差法、能量梯度法、roberts、SMD。 一个好的评价函数需要具有单峰性,无偏性,灵敏性,在本实例中,采用Laplace、能量梯度和Brenner梯度法较好,而方差法效果较差,Tenegrad梯度法反向了。 图像清晰度是用来指导调焦机构找到正焦位置的评价函数。理想的清晰度评价曲线类似于泊松分布,请看下图:^2 p点对应于正焦位置,P1 和P2 为正焦位置焦前和焦后采集到图像的清晰度评价结果。 正焦的图像比模糊的离焦图像边缘要更加的锐利清晰,相应的边缘像素灰度值变化大,因
阅读时间 10 分钟
博客

海康设备接入方式 — IP 直接接入

文档版本: V1.0 适用范围: 煤矿工业视频监控平台 编写日期: 2026-06-12 1. 概述 IP 直接接入是海康摄像机通过以太网直接连接到视频监控平台的基础方式。主要包括三种实现路径: 方式 说明 标准化程度 直接 IP(ISAPI/RTSP) 通过海康私有 HTTP 接口(ISAPI)和标准 RTSP 协议取流 私有 + 标准 ONVIF 开放网络视频接口论坛标准(Profile S/G/T) 国际标准 海康 SDK 海康二次开发动态库,提供完整设备操作接口 私有 三者均基于 TCP/IP 协议栈,摄像机通过工业交换机接入矿区环网或视频专网,平台与设备之间直接通信,无需中间网关或 NVR 硬件。 2.
阅读时间 4 分钟
OpenCV 5 正式发布 — 计算机视觉里程碑更新
技术资讯

OpenCV 5 正式发布 — 计算机视觉里程碑更新

发布时间: 2026年6月4日(CVPR 2026 同期) pip 版本: 2026年6月8日 来源: OpenCV 官方博客 | oschina 资讯 仓库: GitHub 5.x 分支 概述 OpenCV 5 是继 4.x 系列以来最大的一次重大升级,不再是增量更新。核心目标:让深度学习在 OpenCV 中真正可用,同时全面现代化核心库、硬件加速层、3D 视觉和文档体系。 当前数据:86,000+ GitHub Stars,日安装量 100 万+。 一、全新 DNN 引擎(最大亮点) 核心改进 维度 4.
阅读时间 6 分钟
苏ICP备19018690号-1