热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

小白学数据:一文看懂NoSQL数据库

如果你关注大数据科技动向,可能听说过一个叫NoSQL数据库的名词,这可能让人有些云里雾里。其实我们处在一个激动人心的技术更迭时代,以甲骨文

0?wx_fmt=jpeg

如果你关注大数据科技动向,可能听说过一个叫NoSQL数据库的名词,这可能让人有些云里雾里。其实我们处在一个激动人心的技术更迭时代,以甲骨文为代表的SQL数据库已经称霸了企业市场30年,而近年来的NoSQL则是强有力的更新换代的竞争者。这篇文章就通过问答的方式来给小白解释NoSQL数据库系统是什么,无论你的技术背景如何都能看得懂。对于数据分析从业人员来说,了解数据库的趋势可以让你的职业生涯如虎添翼;而对于工程师来说,了解新的基础系统更是必不可少的行业知识。


0?wx_fmt=png

◆ ◆ 

几个基本问题


小白问:数据库是什么东西,可以吃吗?

答:......不可以。数据库呢,就是存储数据的地方,就像冰箱是存储食物的地方一样。

 

小白问:诶?我的数据就存储在自己电脑里面的excel表里里,还要数据库干嘛?

答:自己的数据的确很方便,但是对于企业来说就不一样了。一个公司里面可能有成千上万的Excel表格,还在不同的电脑上,而他们的员工和客户需要实时看到企业给他们提供的所有数据,这种文件管理的方法就很麻烦,总不能每分钟都把一个新的巨大无比的excel文件发给所有客户呀!而且数据库更有用的是进行查询,企业会给内部或者客户开发不同的应用,而这些应用需要数据的时候可以直接实用数据库的查询语句快速得到结果。

 

小白问:哦,那是说所有的人都直接在这个系统上查数据和改数据吗?

答:是的,数据库也会帮助你处理“并发”,也就是如果多个人同时在改数据的情况。比如你在支付宝给小灰转账,而小灰这个时候又偏偏刚好在给你转账,这时候数据库系统就要保证你们两个人最后余额都是正确的,并且在你们进行交易的时候别人如果同时查询你们俩人的余额都会得到精确的结果。在一个企业系统中,一秒钟可能有成千上万个这样的查询和改动发生呢。

 

小白问:那SQL又是什么鬼?

答:SQL是一种可以查询关系型数据库的语言,关系型数据库也叫SQL数据库。

所谓关系型数据库就是数据是以表格的形式进行存储的,就和你电脑上的Excel表一样,数据是一行一列整整齐齐的躺着的。表格之间有着这样或那样的关系,可以通过某信息连接在一起 。想查这些表格里的任何数据的程序员们就可以把他们想要的数据形式转化成SQL语句然后发给数据库,得到数据结果。比如你可以有一个食物管理的数据库,里面有两个表(食物表和主人表),长成下面的这个样子:

 

食物编号食物名称数量 喜爱程度主人编号

1             猕猴桃      4      53

2    菠菜         10      2  2

3巧克力      99    1001

 

主人编号主人姓名      主人性别 

1小白                 女 

2小黑                 男 

3小灰                 男 

 

我们可以写一句简单的SQL语句直接调出所有男主人拥有的食品及数量。

 

SELECT 主人姓名,食物名称,数量

FROM 食物表,主人表

WHERE  食物表.主人编号=主人表.主人编号 AND 主人性别=‘男’

=>

主人姓名食物名称数量

小黑菠菜10

小灰猕猴桃 4


0?wx_fmt=png


◆ ◆ 

深入聊聊


小白问:哦,那NoSQL到底有什么过人之处呢?

答:因为近年来企业要处理的数据越来越多,越来越复杂,就出现了两个之前关系型数据库解决不了的问题:快速增长的数据规模和日渐复杂的数据模型。


第一个问题就是数据越来越多,公司以前买的装关系型数据库的那台电脑放不下了,那这个时候就有两种选择:

一种就是直接去买一台更大空间的计算机取代现有的机器。这个方法是有限制的,因为这种机器的价格一般非常昂贵,而且这个空间总是有一个上限的。


另外一种选择就是再买一台机器,然后把新的数据放到新机器里的另外一个SQL数据库里面,这个过程也叫“分片”(sharding)。 这个时候程序员要开始杯具的加班了。因为这个转换的过程非常容易出问题,而且会给使用数据库的应用增加很多的复杂度。比如我们之前的例子,在查询食品和数量的语句的时候我们要将同样的语句同时发给两个服务器,然后把最后的结果综合起来,给应用的开发增加了很多不必要的负担。分片还有很多别的缺点我就不一一赘述了。


而NoSQL数据库的服务器本身就支持很多个机器存储数据进行分布式查询,这样当空间不够用的时候就直接去扛一台新的机器回来连接到已有的计算机集群上装好数据库即可,程序员可以回家睡个好觉啦。

 

小白问:明白了,那另外一个关系型数据库没有解决的问题呢?

答:另外的一个问题就是把数据放到SQL数据之前要进行数据建模,也就是要考虑好每一个表里面每一列都代表什么,不同的表格之间要怎样相互关联起来。这对很多公司来说是一件非常耗费时间和精力的事情,因为他们的数据源的种类太多了。而且在数据进入数据库之后,如果在表中增加新的一列(比如想把食物的种类加进第一个表中)或者是要改变某一列的特性的话,对于系统来说是非常困难的,因为表中的数据已经一行行的存好了。

而NoSQL数据库就减轻了数据建模的负担,比如上面的表里面的一行可以变成下面JSON文档的样子:

{

食物名称:猕猴桃,

数量:4,

喜爱程度:5,

主人:{

    姓名:小灰,

    性别:男

 }

}


0?wx_fmt=png

这样很方便的可以修改数据模型的样子,而且从源数据不需要怎么改就可以放入数据库。目前用有一个行业叫做ETL,就是专门做数据形状转化的:他们将不同的源数据打磨到想要的表格的模子里,然后放入关系型数据库。这个行业价值好几十亿美元呢,很疯狂吧?用了NoSQL,公司可以节省好多时间和人民币呢。

 

小白:那是说NoSQL就是用文档,而SQL就是用表格吗?

答:NoSQL其实有很多不同的种类的,适用在不同的情况中并且分别有不同的存储方法。JSON是文档类NoSQL的典型格式,我们平时使用的word和pdf文件都可以很容易放入文档型数据库进行查询。而其他种类的NoSQL也可能是用图或者哈希表的模型来存储数据。如果你的数据存储的是一个社交网络类型的应用,那么对你来说用一个基于图的数据库可能更加合适,因为你关心的社交网络场景中的问题都可以得到比较快速的回答。

 

小白问:既然叫NoSQL,那和SQL肯定是水火不容咯?

答:哪有,NoSql其实是Not Only SQL,就是不仅仅是SQL,有一些NoSQL数据库还支持直接用SQL来做查询呢。两者的区别主要是我上面提到的两点: 1.对数据建模的要求不同:NoSQL的建模程序比较简单灵活;2.对数据增加的处理方式不同:使用NoSQL可以直接进行分布式处理。在数据规模增长需要增加新的机器的时候,不需要程序员对使用数据库的应用进行代码进行改动,直接在数据库集群中增加一台新的计算机就可以啦。


---------------------------------- 

预告:这篇文章是NoSQL的入门介绍。如果你对数据库已经有所了解,请期待我们的下一篇文章,将介绍不同种类的NoSQL数据库、如何在不同的应用场景中选取适合的数据库系统以及未来技术展望,敬请期待。


原文发布时间为:2016-04-16

本文来自云栖社区合作伙伴“大数据文摘”,了解相关信息可以关注“BigDataDigest”微信公众号




推荐阅读
  • Java项目分层架构设计与实践
    本文探讨了Java项目中应用分层的最佳实践,不仅介绍了常见的三层架构(Controller、Service、DAO),还深入分析了各层的职责划分及优化建议。通过合理的分层设计,可以提高代码的可维护性、扩展性和团队协作效率。 ... [详细]
  • 本文介绍了一个基于 Java SpringMVC 和 SSM 框架的综合系统,涵盖了操作日志记录、文件管理、头像编辑、权限控制、以及多种技术集成如 Shiro、Redis 等,旨在提供一个高效且功能丰富的开发平台。 ... [详细]
  • 导入大csv文件到mysql(CSV导入) ... [详细]
  • 本文从数据埋点的设计者视角出发,全面解析数据埋点的技术原理、应用场景及其管理方法,涵盖基础知识、实施策略、数据处理流程等内容。 ... [详细]
  • 本文详细介绍了优化DB2数据库性能的多种方法,涵盖统计信息更新、缓冲池调整、日志缓冲区配置、应用程序堆大小设置、排序堆参数调整、代理程序管理、锁机制优化、活动应用程序限制、页清除程序配置、I/O服务器数量设定以及编入组提交数调整等方面。通过这些技术手段,可以显著提升数据库的运行效率和响应速度。 ... [详细]
  • 本文深入探讨了SQL数据库中常见的面试问题,包括如何获取自增字段的当前值、防止SQL注入的方法、游标的作用与使用、索引的形式及其优缺点,以及事务和存储过程的概念。通过详细的解答和示例,帮助读者更好地理解和应对这些技术问题。 ... [详细]
  • 探索新一代API文档工具,告别Swagger的繁琐
    对于后端开发者而言,编写和维护API文档既繁琐又不可或缺。本文将介绍一款全新的API文档工具,帮助团队更高效地协作,简化API文档生成流程。 ... [详细]
  • docker镜像重启_docker怎么启动镜像dock ... [详细]
  • 远程过程调用(RPC)是一种允许客户端通过网络请求服务器执行特定功能的技术。它简化了分布式系统的交互,使开发者可以像调用本地函数一样调用远程服务,并获得返回结果。本文将深入探讨RPC的工作原理、发展历程及其在现代技术中的应用。 ... [详细]
  • 本文详细介绍了如何正确配置Java环境变量PATH,以确保JDK安装完成后能够正常运行。文章不仅涵盖了基本的环境变量设置步骤,还提供了针对不同操作系统下的具体操作指南。 ... [详细]
  • PC时代的传奇人物
    回顾过去几十年,个人电脑(PC)的发展历程犹如一部英雄史诗。每一位杰出人物都在这一领域留下了不可磨灭的印记,他们的贡献不仅推动了技术的进步,也深刻影响了现代社会的发展。 ... [详细]
  • 智慧城市建设现状及未来趋势
    随着新基建政策的推进及‘十四五’规划的实施,我国正步入以5G、人工智能等先进技术引领的智慧经济新时代。规划强调加速数字化转型,促进数字政府建设,新基建政策亦倡导城市基础设施的全面数字化。本文探讨了智慧城市的发展背景、全球及国内进展、市场规模、架构设计,以及百度、阿里、腾讯、华为等领军企业在该领域的布局策略。 ... [详细]
  • 58同城的Elasticsearch应用与平台构建实践
    本文由58同城高级架构师于伯伟分享,由陈树昌编辑整理,内容源自DataFunTalk。文章探讨了Elasticsearch作为分布式搜索和分析引擎的应用,特别是在58同城的实施案例,包括集群优化、典型应用实例及自动化平台建设等方面。 ... [详细]
  • 现代软件工程开发体验:结对编程
    距现代软件工程开课已经3周,按照课程安排,在最近的9天中,我们进行了极限编程模式的体验:pairwork(结对编程,具体见链接),对象是在academicsearchmap上添加一些新特性。经过选 ... [详细]
  • 本文深入浅出地介绍了区块链的基本概念,探讨了这一技术如何通过去中心化的方式实现数据的可靠存储与传输。此外,文章还分析了区块链技术与比特币的关系,以及它在未来各行业的潜在应用。 ... [详细]
author-avatar
小美女金猪宝宝
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有