博客

A collection of 82 posts
博客

大语言模型预训练数据

大语言模型预训练数据^1 在预训练阶段,大语言模型从海量“高质量”文本数据中学习广泛的知识,随后这些知识存储在其模型参数当中。通过预训练使得大语言模型具备了一定程度的语言理解和生成能力。因此,如何构造海量“高质量”数据对于大语言模型预训练具有至关重要的作用。研究表明,预训练数据需要涵盖各种类型的文本,也需要覆盖尽可能多的领域、语言、文化和视角,从而提高大语言模型的泛化能力和适应性。当前大模型预训练使用的语料库涵盖网页内容、学术资料、百科、社交媒体和书籍等文本内容,同时也包含来自不同领域的文本内容,比如法律文件、年度财务报告、医学教科书等其他特定领域的数据。 本章将介绍常见的大语言模型预训练数据的来源、处理方法、预训练数据对大语言模型影响的分析及开源数据集等。 数据来源 文献 [13] 介绍了 OpenAI 训练 GPT-3 使用的主要数据来源,包含经过过滤的 CommonCrawl数据集[19]、WebText 2、Books 1、Books 2 及英文 Wikipedia 等数据集。其中
阅读时间 75 分钟
博客

大模型原理

大模型原理 绪论 大语言模型是一种由包含数百亿个及以上参数的深度神经网络构建的语言模型,通常使用自监督学习方法通过大量无标注文本进行训练。^1 2018 年以来,Google、OpenAI、Meta、百度、华为等公司和研究机构相继发布了 BERT、GPT等多种模型,这些模型在几乎所有自然语言处理任务中都表现出色。2019 年,大语言模型呈现爆发式的增长,特别是 2022 年 11 月 ChatGPT(Chat Generative Pre-trained Transformer)的发布,引起了全世界的广泛关注。用户可以使用自然语言与系统交互,实现问答、分类、摘要、翻译、聊天等从理解到生成的各种任务。大语言模型展现出了强大的对世界知识的掌握和对语言的理解能力。 语言模型(Language Model,LM)的目标就是对自然语言的概率分布建模。词汇表 V 上的语言模型,由函数 P(w1w2 · · · wm) 表示,
阅读时间 76 分钟
博客

大模型汇总

大模型汇总 大模型 LFM2.5^1 2026年1月8号 LFM2.5是Liquid AI在2026年1月发布的新一代小型基础模型家族,专为边缘设备设计,强调高效的多模态处理和离线推理能力。下表概括了其主要模型及特点。 模型名称 参数规模 核心功能/特点 关键性能/应用场景 LFM2.5-1.2B-Instruct 12亿 通用文本模型,擅长指令遵循、知识推理与工具调用,在GPQA和MMLU-Pro等基准测试中领先同类1B级模型 LFM2.5-1.2B-JP 12亿 针对日语任务优化,在JMMLU等日语基准测试中表现优异 LFM2.5-VL-1.6B 16亿 视觉语言模型,集成视觉模块以理解图像;支持文档理解、界面读取和多图像推理 LFM2.5-Audio-1.5B 15亿 音频语言模型,支持文本和音频输入输出;处理速度较前代提升8倍,适用于实时语音对话和识别 💡 模型核心优势 LFM2.
阅读时间 7 分钟
博客

存储汇总

存储汇总 存储系统 CubeFS 总结 CubeFS 是一个开源的云原生分布式文件系统,于2024年成为云原生计算基金会(CNCF)毕业项目。它旨在通过一套存储系统同时支持文件、对象和大数据等多种存储协议,并能灵活适配从高性能计算到海量冷数据归档的多样化场景4。 核心特性 1. 多协议支持 CubeFS 兼容 POSIX(如本地磁盘)、S3(对象存储)、HDFS(大数据)协议,且数据在不同协议间互通4。 2. 双存储引擎 3. 多副本引擎:提供高可用性和低延迟,适用于对性能要求高的场景。 4. 纠删码引擎:具备高可靠性、高可用性、低成本的特点,支持超大规模(EB级别)存储4。 5. 云原生与可扩展性 6. 原生支持多租户隔离和容器存储接口(CSI),易于在 Kubernetes 上部署和运维4。 7. 各模块可水平扩展,轻松构建
阅读时间 3 分钟
博客

分布式存储

分布式存储 分布式存储系统,是将数据分散存储在多台独立的设备上。传统的网络存储系统采用集中的存储服务器存放所有数据,存储服务器成为系统性能的瓶颈,也是可靠性和安全性的焦点,不能满足大规模存储应用的需要。分布式网络存储系统采用可扩展的系统结构,利用多台存储服务器分担存储负荷,利用位置服务器定位存储信息,它不但提高了系统的可靠性、可用性和存取效率,还易于扩展。 分布式存储最早是由谷歌提出的,其目的是通过廉价的服务器来提供使用与大规模,高并发场景下的 Web 访问问题。它 采用可扩展的系统结构,利用多台存储服务器分担存储负荷,利用位置服务器定位存储信息,它不但提高了系统的可靠性、可用性和存取效率,还易于扩展。 分布式存储的兴起与互联网的发展密不可分,互联网公司由于其数据量大而资本积累少,而通常都使用大规模分布式存储系统。 与传统的高端服务器、高端存储器和高端处理器不同的是,互联网公司的分布式存储系统由数量众多的、低成本和高性价比的普通 PC 服务器通过网络连接而成。其主要原因有以下三点 (1) 互联网的业务发展很快,而且注意成本消耗,这就使得存储系统不能依靠传统的纵向扩展
阅读时间 84 分钟
博客

图像清晰度

图像清晰度 图像清晰度是衡量图像质量的一个重要指标,对于相机来说,其一般工作在无参考图像的模式下,所以在拍照时需要进行对焦的控制。对焦不准确,图像就会变得比较模糊不清晰。相机对焦时通过一些清晰度评判指标,控制镜头与CCD的距离,使图像成像清晰。一般对焦时有一个调整的过程,图像从模糊到清晰,再到模糊,确定清晰度峰值,再最终到达最清晰的位置。^1 常见的图像清晰度评价一般都是基于梯度的方法,本文将介几种简单的评价指标,分别是Brenner梯度法、Tenegrad梯度法、laplace梯度法、方差法、能量梯度法、roberts、SMD。 一个好的评价函数需要具有单峰性,无偏性,灵敏性,在本实例中,采用Laplace、能量梯度和Brenner梯度法较好,而方差法效果较差,Tenegrad梯度法反向了。 图像清晰度是用来指导调焦机构找到正焦位置的评价函数。理想的清晰度评价曲线类似于泊松分布,请看下图:^2 p点对应于正焦位置,P1 和P2 为正焦位置焦前和焦后采集到图像的清晰度评价结果。 正焦的图像比模糊的离焦图像边缘要更加的锐利清晰,相应的边缘像素灰度值变化大,因
阅读时间 10 分钟
博客

海康设备接入方式 — IP 直接接入

文档版本: V1.0 适用范围: 煤矿工业视频监控平台 编写日期: 2026-06-12 1. 概述 IP 直接接入是海康摄像机通过以太网直接连接到视频监控平台的基础方式。主要包括三种实现路径: 方式 说明 标准化程度 直接 IP(ISAPI/RTSP) 通过海康私有 HTTP 接口(ISAPI)和标准 RTSP 协议取流 私有 + 标准 ONVIF 开放网络视频接口论坛标准(Profile S/G/T) 国际标准 海康 SDK 海康二次开发动态库,提供完整设备操作接口 私有 三者均基于 TCP/IP 协议栈,摄像机通过工业交换机接入矿区环网或视频专网,平台与设备之间直接通信,无需中间网关或 NVR 硬件。 2.
阅读时间 4 分钟
苏ICP备19018690号-1