深入理解Sqlserver文件存储之页和应用

作者：shao4224 | 来源：互联网 | 2023-05-19 10:22

我们每天都在使用数据库，我们部门使用最多的关系数据库有Sqlserver，Oracle，有没有想过这些数据库是怎么存放到操作系统的文件中的？有时候为了能够设计出最优的表结构，写出高性能的Sqlserv

我们每天都在使用数据库，我们部门使用最多的关系数据库有Sqlserver，Oracle，有没有想过这些数据库是怎么存放到操作系统的文件中的？有时候为了能够设计出最优的表结构，写出高性能的Sqlserver脚本，处理海量数据并发，我们必须解底层原理。由于个人兴趣最近研究了下Sqlserver的文件存储，由于水平有限，下面只讲解Sqlserver的最小存储单元-页。

什么是页，区？

什么会有一个页的概念，我们知道对于操作系统来说，文件可以认为是一个很大的线性空间，如果按地址空间顺序分配容量（也就是按段式存储），则有可能会造成很多的外部碎片，造成很多的容量很难再次使用，只有移动合并空间才能腾出更多的空间。例如：如下表所有，如果我现在要申请1024B字节的空间，显然下面的两个空间空间单个计算不够，合起来却是够用的的，只能移动合并空间。

8KB	512B	12KB	512B	8KB
已分配空间	空闲	已分配空间	空闲	已分配空间

表1

为了能够更好的利用磁盘空间，Sqlserver借鉴了操作系统的虚拟内存的概念，人为的将文件划分N个8KB的存储空间，这样每次分配时，都是按照8KB空间申请，就解决了外部碎片的问题，也就是说Sqlserver 中数据存储的基本单位，页的大小为8KB，每页的开头是96字节的标头用于存储有关页的存储信息，其中有页码、页类型、页的可用空间以及拥有该页对象的分配单元ID。上述的例子分配就成为下表所示:这样就解决了外部碎片问题。

业内分配	8kB	12KB		8KB	xxKB
页单元	8KB	8KB	8KB	8KB	空闲

表2

为什么会有区的概念，已经有了页的单位难道不够吗？主要是为了更好的管理这些空间，Sqlserver将每8个页划分为一个区（如下表所示）就像百元大钞代表着100个10元人民币一样，出去买很多东西时，用百元大钞比用很多1元钱要方面。

一个分区
页1	页2	页3	页4	页5	页6	页7	页8

表3

为了有个页有更具体的认识，下表为页头的结构：

图-1

行是怎么在页中存储的？

那么数据库中的数据到底是以什么样的形式存储在数据中的呢？Sqlserver是以行为单位存储的数据，也就是说表中的每条数据（每行数据为一个块）顺序存放在页中的，那么怎么找到行？也就是一行的开始地址和结束地址? Sqlserver在每页的末尾以2个字节为单位存放了每行的开始地址，这样我们就可以定位到行的开始，通过下一条的开始位置能够知道本条记录的结束位置，这样我们就可以取出这行数据了。

图-2

如图所示，如果我想取第二条数据，那么现将一页数据都读到内存中，然后从最后读取偏移为第3开始开始读取2个字节，怎么可以找到行2的开始位置，同理可以读取出行2的结束位置。

列是怎么在页中的存储？

现在我们已经读取到行了并且已经在内存里了，接下来怎么解析出一行中的所有列？也就是这些列是怎么存放的？数据库表中的列无非就两种情况：定长列、变长列。

首先假设只有定长列，那么很容易想到一样中的每列的之顺序存放就行了，因为是定长的，完全可以将每列的偏移放到另外一个地方单独存储，如果要取某个特定的列，每个列的位置很容易定位:如下表所示:

2字节	3字节	6字节	10字节	3字节	2字节
1	23	55	A	C	D

表-4

如果要取红色的数据，那么它的

开始位置=（行开始位置）+ 2字节+3字节+6字节+10字节。

结束位置= 开始位置 + 3字节。

其中每个列的长度完全可以用另一张表存放

列	1	2	3	4	5	6
长度（字节）	2	3	6	10	3	2

表-5

具体行结构的详细信息如下：

图-3

假如设计的表结构为 :

Col1	Col2	Col3	Col4
Char(5)(not null)	Int (null)	Char(3)(null)	Char(6)(not null)

表-6

在数据库中存放数据为:

Col1	Col2	Col3	Col4
‘ABCDE’	‘123’	‘null’	‘ccc ‘

表-7

则数据在数据库文件中数据以如下形式存在:

图-4

如果其中有变长列呢，这个结构又是怎么存储的？有变长列最大的不同就是每个列的长度是不定的（同一列，每行长度都不一样），也就是不能用另外一张表存放。那么我们只能把列的长度放在行内了。这样就解决了实际长度定位的问题，上面已经说过，sqlserver有一个行偏移矩阵。

如果我们定义的表结构如下：

Col1	Col2	Col3	Col4	Col5
Char(2)(not null)	Varchar(250)(not null)	Varchar(5)(null)	Varchar(20)(not null)	Small int (null)

表-8

假如这行数据为：

Col1	Col2	Col3	Col4	Col5
‘AAA’	RELICATE(‘X’,250)	null	‘ABC’	123

表-9

则数据在数据库中实际的存放形式为:

图-5

结论：

1.数据库列中尽量不用可空类型，当值为空时，实际不占用位置，并且也不能作为索引的键值。导致where语句中含有 is null 或者 is not null 时只能进行全表扫描，并且可空类型也容易导致空引用异常。

2．在设计列时，只有列长度确定的才用定长，比如身份证。其他情况基本上应该用varchar边长类型，不但节省空间的同时，一个页存放的数据会变多。导致同样的数据量读取页的次数变少，减少I/O，提高性能。

3.如图-1所示，聚簇索引不是按物理顺序存放的，是按逻辑物理顺序存放的（大多数人在这里会有误解。）

4.正常情况下不要使用varchar(max),因为这个列的数据肯定放不在一个页里，为了解决这个问题，sqlserver在列里只存放了一个指针。真正的数据放在了其他多个页里。每读取一行中的列都会至少多一次I/O，影响性能。

附注,参考资料：

(1) Microsoft SQL Server 2005技术内幕：存储引擎(中文)

(2)微软MSDN: http://msdn.microsoft.com/zh-cn/library/ms190969(v=sql.105).aspx

推荐阅读

select
定制数据层_sqlserver

定制数据层关键字：数据层，访问，元数据，数据访问模型http://www.gaodaima.com/35448.html定制数据层_sqlserver ... [详细]

蜡笔小新 2023-10-10 12:26:17
client
Nacos 0.3 数据持久化详解与实践

本文详细介绍了如何将 Nacos 0.3 的数据持久化到 MySQL 数据库，并提供了具体的步骤和注意事项。 ... [详细]

蜡笔小新 2024-11-14 18:26:40
cmd
在CentOS 7环境中安装配置Redis及使用Redis Desktop Manager连接时的注意事项与技巧

在 CentOS 7 环境中安装和配置 Redis 时，需要注意一些关键步骤和最佳实践。本文详细介绍了从安装 Redis 到配置其基本参数的全过程，并提供了使用 Redis Desktop Manager 连接 Redis 服务器的技巧和注意事项。此外，还探讨了如何优化性能和确保数据安全，帮助用户在生产环境中高效地管理和使用 Redis。 ... [详细]

蜡笔小新 2024-11-11 18:27:44
select
关于SQLSERVER的全文目录跟全文索引的区别

很久没有写随笔了，本来之前想写一篇关于SQLSERVER全文索引的随笔，可惜没有时间，一直拖到现在才有时间写，不好意思让各位久等了~先介绍一下SQLSERVER中的存储类对象，哈哈，先介绍一下概念嘛 ... [详细]

蜡笔小新 2023-10-11 11:25:01
select
Java连接SqlServer2008数据库（转）

Java连接SqlServer2008数据库首先下载JDBC：下载地址：http:www.microsoft.comzh-cndownloaddetails.aspx?id21599下载 ... [详细]

蜡笔小新 2023-10-10 13:15:33
select
【存档归纳】Sqlserver数据库详解 ----深度挖掘sqlserver帮助所得一

在Sqlserver数据库历代版本当中，系统数据库有四个，master，model，msdb，tempdbmaster----记录SQLServer系统的所有系统级信息。这包括实例范围的元数 ... [详细]

蜡笔小新 2023-10-10 11:11:58
select
SQLServer与Access数据库ASP代码有什么区别

这篇文章主要讲解了“SQLServer与Access数据库ASP代码有什么区别”，文中的讲解内容简单清晰，易于学习与理解，下面请大家跟着小编的思路慢慢深 ... [详细]

蜡笔小新 2023-09-24 14:43:05
php
ABP框架概览及其前后端开发系列（一）

ABP框架是ASP.NET Boilerplate的简称，它不仅是一个开源且文档丰富的应用程序框架，还提供了一套基于领域驱动设计（DDD）的最佳实践架构模型。本文将详细介绍ABP框架的特点、项目结构及其在Web API优先架构中的应用。 ... [详细]

蜡笔小新 2024-11-16 18:09:51
uri
设计无SQL死锁的编码模式 - Achieving SQL Deadlock-Free Design

在运行于MS SQL Server 2005的.NET 2.0 Web应用中，我偶尔会遇到令人头疼的SQL死锁问题。过去，我们主要通过调整查询来解决这些问题，但这既耗时又不可靠。我希望能找到一种确定性的查询模式，确保从设计上彻底避免SQL死锁。 ... [详细]

蜡笔小新 2024-11-16 13:09:51
php
包含phppdoerrorcode的词条

包含phppdoerrorcode的词条 ... [详细]

蜡笔小新 2024-11-14 12:06:14
php
当当开源shardingjdbc，轻量级数据库分库分表中间件详解数据库

近期，当当开源了数据库分库分表中间件sharding-jdbc。Sharding-JDBC是当当应用框架ddframe中，从关系型数据库模块dd-rdb中分离出来的数据库水平分片框 ... [详细]

蜡笔小新 2023-10-10 18:46:02
client
SQL Server 2000 的工具_sqlserver

1.3.4ProfilerSQLServerProfiler是一个图形化的管理工具用于监督记录和检查SQLServer数据库的使用情况对系统管理员来说它是一个监视用户活动的间谍1. ... [详细]

蜡笔小新 2023-10-10 15:45:49
client
SqlServer存储过程异常处理

微软平台的软件开发系统中，有着一套自己的约定规则。熟悉.net开发的都会对异常处理不陌生，现阶段的各种编程语言中，都不乏异常处理机制，个中原理也都大同小异。sqlserver在批处 ... [详细]

蜡笔小新 2023-10-10 15:10:34
select
SQLServer2008全套数据库简介，分离，收缩，快照

第三课视频笔记：联机丛书的使用附加和分离数据库---收缩数据库--------数据库快照 ... [详细]

蜡笔小新 2023-09-25 06:09:52
select
日志不停的在刷新SQLSERVER 错误

在目标队列中对消息进行排队时出现异常。错误:15404，状态:19。CouldnotobtaininformationaboutWindowsNTgroupuserSERVER ... [详细]

蜡笔小新 2023-09-24 15:36:20

shao4224

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章