热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

大数据算法(一)亚线性算法

来源:大数据算法王宏志一、概述大数据定义:在给定的资源约束下,以大数据为输入,在给定时间约束内可以生成满足给定约束结果的算法。大数据特点:4V大数据算法可以不是:精确算法内存算法串

来源:大数据算法 王宏志 

一、概述

大数据定义:在给定的资源约束下,以大数据为输入,在给定时间约束内可以生成满足给定约束结果的算法。

大数据特点:4V

大数据算法可以不是:

  • 精确算法
  • 内存算法
  • 串行算法
  • 仅在电子计算机上运行的算法

大数据算法不仅是:

  • 云计算
  • MapReduce
  • 大数据分析和挖掘的算法

难度:

  • 访问全部数据时间过长

               读取部分数据 亚线性算法

  • 数据难以放入内存

               将数据存储到磁盘上 外存算法

               仅基于少量数据进行计算 空间亚线性算法

  • 单个计算机难以保存全部数据

               并行处理 并行算法

  • 计算机能力不足或知识不足

              人来帮忙 众包算法

大数据上问题求解计算问题的过程

技术图片

大数据的算法设计技术

  • 精确算法设计方法
  • 并行计算
  • 近似计算
  • 随机算法
  • 在线算法/数据流算法
  • 外存算法
  • 面向新型体系结构的算法
  • 现代优化算法

大数据算法分析

  • 时间空间复杂性
  • IO复杂性
  • 结果质量(近似比、competitive ratio)
  • 通讯复杂性

二、亚线性算法概述

1.定义

时间/空间/IO/通讯/能量等消耗是o(输入规模)

亚线性时间算法

  • 性质检测算法
  • 亚线性时间近似算法

亚线性空间算法

  • 数据流算法

2.空间亚线性算法-水库抽样

输入:一组数据,其大小未知

输出:这组数据的k个均匀抽样

要求:

  • 仅扫描数据一次
  • 空间复杂性为O(k) 和抽样大小有关,和整个数据无关
  • 扫描到数据的前n个数字时(n>k),保存当前已扫描数据的k个均匀抽样

算法:

  • 申请一个长度为k的数组A保存抽样
  • 保存首先接收到的k个元素
  • 当接收到第i个新元素t时,以k/i的概率随机替换A中的元素(即生成[1, i]间随机数j,若k<=j,则以t替换A[j]

技术图片

3.时间亚线性计算算法-平面图直径

输入:m个顶点的平面图,任意两点之间的距离存储在矩阵D中,即点i到点j的距离为Dij

  • 输入大小是n=m的平方
  • 最大的Dij是图的直径
  • 点之间的距离对称且满足三角不等式

输出:该图的直径和距离最大的Dij

要求:运行时间为o(n)

算法:

动机:无法在要求的时间内得到精确算法,寻找近似算法

近似算法

  • 任意选择k<=m
  • 选择使得Dkl最大的l
  • 输出Dkl和(k, l)

近似比

Dij <= Dik+Dkj <= Dkl+Dk l<= 2Dkl 因而近似比为2

近似时间

技术图片

4.近似算法 

什么是近似算法

  • 近似算法主要用来解决优化问题
  • 能够给出一个优化问题的近似优化解的算法

近似算法解的近似度

  • 问题的每一个可能的解都具有一个代价
  • 问题的优化解可能具有最大或最小代价
  • 我们希望寻找问题的一个误差最小的近似优化解

我们需要分析近似解代价与优化解代价的差距

  • Ratio Bound
    • 技术图片
  • 相对误差
    • 技术图片
  • (1-ε)-近似

5.时间亚线性判定算法-全0数组判定

输入:包含n个元素的0,1数组A

输出:A中的元素是否全是0

要求:运行时间为o(n)

判定问题的近似:

  • 无法在要求的时间内得到精确解,寻找近似解

                判定问题如何近似

  • 输入满足某种性质或者远非满足此性质

技术图片 技术图片

  •  ε-远离

            对于输入x,如果x到L中的任意字符串的汉明距离至少为ε|x|,则x是ε-远离L的

全0数组判定问题的近似

  • 是否A=00...0或者其包含1的个数大于 εn?

算法描述:

  • 在A中随机独立抽取s= 2/ε个位置上的元素
  • 检查抽样,若不包含1,则输出“是”,若包含1,则输出“否”

判定精确性分析

  • 如果A是全0数组,始终输出“是”
  • 如果A是 ε-远离的,技术图片

运行时间:O(s)

证据引理:

  • 如果一次测试以大于等于p的概率获得一个证据,那么s=2/p轮测试得到证据的概率大于等于2/3

判定算法的定义

技术图片

三、亚线性算法案例

技术图片

大数据算法(一)亚线性算法


推荐阅读
  • 动态规划算法的基本步骤及最长递增子序列问题详解
    本文详细介绍了动态规划算法的基本步骤,包括划分阶段、选择状态、决策和状态转移方程,并以最长递增子序列问题为例进行了详细解析。动态规划算法的有效性依赖于问题本身所具有的最优子结构性质和子问题重叠性质。通过将子问题的解保存在一个表中,在以后尽可能多地利用这些子问题的解,从而提高算法的效率。 ... [详细]
  • 《数据结构》学习笔记3——串匹配算法性能评估
    本文主要讨论串匹配算法的性能评估,包括模式匹配、字符种类数量、算法复杂度等内容。通过借助C++中的头文件和库,可以实现对串的匹配操作。其中蛮力算法的复杂度为O(m*n),通过随机取出长度为m的子串作为模式P,在文本T中进行匹配,统计平均复杂度。对于成功和失败的匹配分别进行测试,分析其平均复杂度。详情请参考相关学习资源。 ... [详细]
  • 本文介绍了lua语言中闭包的特性及其在模式匹配、日期处理、编译和模块化等方面的应用。lua中的闭包是严格遵循词法定界的第一类值,函数可以作为变量自由传递,也可以作为参数传递给其他函数。这些特性使得lua语言具有极大的灵活性,为程序开发带来了便利。 ... [详细]
  • 本文介绍了使用Java实现大数乘法的分治算法,包括输入数据的处理、普通大数乘法的结果和Karatsuba大数乘法的结果。通过改变long类型可以适应不同范围的大数乘法计算。 ... [详细]
  • 在说Hibernate映射前,我们先来了解下对象关系映射ORM。ORM的实现思想就是将关系数据库中表的数据映射成对象,以对象的形式展现。这样开发人员就可以把对数据库的操作转化为对 ... [详细]
  • 知识图谱——机器大脑中的知识库
    本文介绍了知识图谱在机器大脑中的应用,以及搜索引擎在知识图谱方面的发展。以谷歌知识图谱为例,说明了知识图谱的智能化特点。通过搜索引擎用户可以获取更加智能化的答案,如搜索关键词"Marie Curie",会得到居里夫人的详细信息以及与之相关的历史人物。知识图谱的出现引起了搜索引擎行业的变革,不仅美国的微软必应,中国的百度、搜狗等搜索引擎公司也纷纷推出了自己的知识图谱。 ... [详细]
  • 本文讲述了作者通过点火测试男友的性格和承受能力,以考验婚姻问题。作者故意不安慰男友并再次点火,观察他的反应。这个行为是善意的玩人,旨在了解男友的性格和避免婚姻问题。 ... [详细]
  • 本文详细介绍了Linux中进程控制块PCBtask_struct结构体的结构和作用,包括进程状态、进程号、待处理信号、进程地址空间、调度标志、锁深度、基本时间片、调度策略以及内存管理信息等方面的内容。阅读本文可以更加深入地了解Linux进程管理的原理和机制。 ... [详细]
  • 1,关于死锁的理解死锁,我们可以简单的理解为是两个线程同时使用同一资源,两个线程又得不到相应的资源而造成永无相互等待的情况。 2,模拟死锁背景介绍:我们创建一个朋友 ... [详细]
  • 后台获取视图对应的字符串
    1.帮助类后台获取视图对应的字符串publicclassViewHelper{将View输出为字符串(注:不会执行对应的ac ... [详细]
  • 本文介绍了通过ABAP开发往外网发邮件的需求,并提供了配置和代码整理的资料。其中包括了配置SAP邮件服务器的步骤和ABAP写发送邮件代码的过程。通过RZ10配置参数和icm/server_port_1的设定,可以实现向Sap User和外部邮件发送邮件的功能。希望对需要的开发人员有帮助。摘要长度:184字。 ... [详细]
  • Java验证码——kaptcha的使用配置及样式
    本文介绍了如何使用kaptcha库来实现Java验证码的配置和样式设置,包括pom.xml的依赖配置和web.xml中servlet的配置。 ... [详细]
  • 高质量SQL书写的30条建议
    本文提供了30条关于优化SQL的建议,包括避免使用select *,使用具体字段,以及使用limit 1等。这些建议是基于实际开发经验总结出来的,旨在帮助读者优化SQL查询。 ... [详细]
  • 本文介绍了指针的概念以及在函数调用时使用指针作为参数的情况。指针存放的是变量的地址,通过指针可以修改指针所指的变量的值。然而,如果想要修改指针的指向,就需要使用指针的引用。文章还通过一个简单的示例代码解释了指针的引用的使用方法,并思考了在修改指针的指向后,取指针的输出结果。 ... [详细]
  • 在project.properties添加#Projecttarget.targetandroid-19android.library.reference.1..Sliding ... [详细]
author-avatar
幽忧白雪666
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有