热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

MongoShell版和C#版的MongoDBMap-Reduce操作

最近有在学习MongoDB,看到了关于Map-Reduce,觉得蛮有意思的,所以在这里就记录下来作为学习笔记。关于Map-Reduce的作用这里就引用一下官网以及另外一篇文章看到的,言简意赅。1.官网:http://docs.mongodb.org/manual/tutorial/map-reduce-examples

最近有在学习MongoDB,看到了关于Map-Reduce,觉得蛮有意思的,所以在这里就记录下来作为学习笔记。

关于Map-Reduce的作用这里就引用一下官网以及另外一篇文章看到的,言简意赅。

1. 官网:http://docs.mongodb.org/manual/tutorial/map-reduce-examples/

The map-reduce operation is composed of many tasks, including:

reads from the input collection,

executions of the map function,

executions of the reduce function,

writes to the output collection.

2.另一篇文章:http://openmymind.net/2011/1/20/Understanding-Map-Reduce/

So what advantage does map reduce hold? The oft-cited benefit is that both the map and reduce operations can be distributed. So the code I've written above could be executed by multiple threads, multiple cpus, or even thousands of servers as-is. This is key when dealing with millions and billions of records, or smaller sets with more complex logic. For the rest of us though, I think the real benefit is the power of being able to write these types of transforms using actual programming languages, with variables, conditional statements, methods and so on. It is a mind shift from the traditional approach, but I do think even slightly complex queries are cleaner and easier to write with map reduce. We didn't look at it here, but you'll commonly feed the output of a reduce function into another reduce function - each function further transforming it towards the end-result.

好的,官网上说的是map-reduce在执行的时候包括哪些操作,步骤;另一篇文章说得是map-reduce有什么好处相对于传统的group by之类操作,而且还有他自己的见解,大家可以看看这篇文章。

接下来我就举个例子,加深对map-reduce的理解,考虑到我们有这样的一个表(说成表相对于传统数据库更好理解,NoSql里面称之为Collection),里面有字段_id,cusid,price(NoSql里面称保存字段的每条记录为Document),里面有数据如下:

Input:

=========================

{      cusid:1,    price:15      };
{      cusid:2,    price:30      };
{      cusid:2,    price:45      };
{      cusid:3,    price:45      };
{      cusid:4,    price:5        };
{      cusid:5,    price:65      };
{      cusid:1,    price:10      };
{      cusid:1,    price:30      };
{      cusid:5,    price:30      };
{      cusid:4,    price:100    };

=========================

但是我们想要得到的数据是根据cusid统计price的总和,这个可以利用group by来实现,但是前面的2个引用说了map-reduce的优势,尤其是大数据的时候,优势会很明显,那么我们就用map-reduce来实现,输出数据如下:

Output:

=========================

{      cusid:1,    price:55         };
{      cusid:2,    price:75         };
{      cusid:3,    price:45         };
{      cusid:4,    price:105      };
{      cusid:5,    price:95        };

=========================

基本的要求介绍完了,下面我们就一一实现,首先是

一. Mongo Shell 版本:

1. 首先我们编写map function来处理每一个Document(其实就是编写js脚本,但是又不同)。

红色方框里面的就是,上面的是我插入的记录数据,应该注意到了里面有一个emit函数,其作用就是做一个key-value匹配,这里就是将每一个Document的price匹配到对应的cusid中,很容易理解,是的。

2. 编写对应的reduce function,这里的functio有2个参数,key-values,对,不是key-value,values是一个数组,这里相当于做了一个group操作,全部对应一个cusid,cusid-prices。

reduceFunction主要的操作就是对每一个不同的cusid的price做求和,得到结果。

3. 执行map-reduce操作,并输出结果到一个临时的Collection中去。

红色部分即为我们要的结果,与Output结果一致。这里有一点疑问,就是cusid = 3的时候,结果的格式与其他的不一样,猜测可能是因为当cusid = 3的记录只有一条,所以就不会做类似group的操作,简言之就不会执行reduceFunction了,如果想要验证这个猜测,我们可以在插入一条cusid = 3的记录,看看结果是否会变化。

事实证明猜测是正确的,cusid = 3的结果和其他的一致了。~_~

未完待续,敬请期待!


推荐阅读
  • MongoDB核心概念详解
    本文介绍了NoSQL数据库的概念及其应用场景,重点解析了MongoDB的基本特性、数据结构以及常用操作。MongoDB是一个高性能、高可用且易于扩展的文档数据库系统。 ... [详细]
  • 在CentOS 7环境中安装配置Redis及使用Redis Desktop Manager连接时的注意事项与技巧
    在 CentOS 7 环境中安装和配置 Redis 时,需要注意一些关键步骤和最佳实践。本文详细介绍了从安装 Redis 到配置其基本参数的全过程,并提供了使用 Redis Desktop Manager 连接 Redis 服务器的技巧和注意事项。此外,还探讨了如何优化性能和确保数据安全,帮助用户在生产环境中高效地管理和使用 Redis。 ... [详细]
  • 本文将深入探讨MySQL与MongoDB在游戏账户服务中的应用特点及优劣。通过对比这两种数据库的性能、扩展性和数据一致性,结合实际案例,帮助开发者更好地选择适合游戏账户服务的数据库方案。同时,文章还将介绍如何利用Erlang语言进行高效的游戏服务器开发,提升系统的稳定性和并发处理能力。 ... [详细]
  • 一家位于长沙的知名网络安全企业,现面向全国诚聘高级后端开发工程师,特别欢迎具有一线城市经验的技术精英回归故乡,共创辉煌。 ... [详细]
  • 本文介绍了如何使用Node.js通过两种不同的方法连接MongoDB数据库,包括使用MongoClient对象和连接字符串的方法。每种方法都有其特点和适用场景,适合不同需求的开发者。 ... [详细]
  • Python 数据可视化实战指南
    本文详细介绍如何使用 Python 进行数据可视化,涵盖从环境搭建到具体实例的全过程。 ... [详细]
  • MongoDB高可用架构:深入解析Replica Set机制
    MongoDB的高可用架构主要依赖于其Replica Set机制。Replica Set通过多个mongod节点的协同工作,实现了数据的冗余存储和故障自动切换,确保了系统的高可用性和数据的一致性。本文将深入解析Replica Set的工作原理及其在实际应用中的配置和优化方法,帮助读者更好地理解和实施MongoDB的高可用架构。 ... [详细]
  • MongoDB Aggregates.group() 方法详解与编程实例 ... [详细]
  • 在使用关系型数据库时,通常需要通过用户名和密码进行身份验证才能访问数据。然而,MongoDB默认情况下并不强制要求这种身份验证机制,使得用户无需凭据即可访问并执行各种操作。虽然这一设计简化了初学者的上手过程,但也带来了显著的安全风险。为了提升MongoDB的连接安全性,本文将探讨多种策略与实践,包括启用身份验证、配置网络访问控制、加密通信以及定期审计安全设置,以确保数据库的安全性和数据的完整性。 ... [详细]
  • NoSQL数据库,即非关系型数据库,有时也被称作Not Only SQL,是一种区别于传统关系型数据库的管理系统。这类数据库设计用于处理大规模、高并发的数据存储与查询需求,特别适用于需要快速读写大量非结构化或半结构化数据的应用场景。NoSQL数据库通过牺牲部分一致性来换取更高的可扩展性和性能,支持分布式部署,能够有效应对互联网时代的海量数据挑战。 ... [详细]
  • Linux学习精华:程序管理、终端种类与命令帮助获取方法综述 ... [详细]
  • 为何Serverless将成为未来十年的主导技术领域?
    为何Serverless将成为未来十年的主导技术领域? ... [详细]
  • Spring Boot与Redis的高效集成方案
    本文探讨了Spring Boot与Redis的高效集成方法,详细介绍了如何在Spring Boot项目中配置和使用Redis,以提升应用性能和数据处理能力。同时,文章还涉及了Go语言社区的相关资源,为Golang开发者提供了宝贵的技术交流平台。 ... [详细]
  • 我了解的差别有: ... [详细]
  • nsitionalENhttp:www.w3.orgTRxhtml1DTDxhtml1-transitional.dtd ... [详细]
author-avatar
keleisibuo
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有