热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

Programming学习2_大数据常用十种开发语言

随着大数据热潮持续延烧,几乎每个产业都有如洪水般倾泻的信息,面对上万笔的顾客浏览纪录、购买行为数据,如果要用Excel来进行数据处理真是太

 随着大数据热潮持续延烧,几乎每个产业都有如洪水般倾泻的信息,面对上万笔的顾客浏览纪录、购买行为数据,如果要用 Excel 来进行数据处理真是太不切实际了,Excel 相较于其他统计软件的功能已相去甚远;但如果只会操作统计软件而不会用逻辑分析数据背后的涵义与事实现况相应证的话,那也不过只能做数据处理,替代性很高的工作,而无法深入规划策略的核心。

  当然,基本功是最不可忽略的环节,想要成为数据科学家,对于这几个程序你应该要有一定的认识:

  R

  若要列出所有程序语言,你能忘记其他的没关系,但最不能忘的就是 R。从 1997 年悄悄地出现,最大的优势就是它免费,为昂贵的统计软件像是 Matlab 或 SAS 的另一种选择。

  但是在过去几年来,它的身价大翻转,变成了资料科学界眼中的宝。不只是木讷的统计学家熟知它,包括 Wall Street 交易员、生物学家,以及硅谷开发者,他们都相当熟悉 R。多元化的公司像是 Google、Facebook、美国银行以及 New York Times 通通都使用 R,它的商业效用持续提高。

  R 的好处在于它简单易上手,透过 R,你可以从复杂的数据集中筛选你要的数据,从复杂的模型函数中操作数据,建立井然有序的图表来呈现数字,这些都只需要几行程序代码就可以了,打个比方,它就像是好动版本的 Excel。

  R 最棒的资产就是活跃的动态系统,R 社群持续地增加新的软件包,还有以内建丰富的功能集为特点。目前估计已有超过 200 万人使用 R,最近的调查显示,R 在数据科学界里,到目前为止最受欢迎的语言,占了回复者的 61%(紧追在后的是 39% 的 Python)。

  它也吸引了 Wall Street 的注目。传统而言,证券分析师在 Excel 档从白天看到晚上,但现在 R 在财务建模的使用率逐渐增加,特别是可视化工具,美国银行的副总裁 Niall O’Conno 说,「R 让我们俗气的表格变得突出」。

  在数据建模上,它正在往逐渐成熟的专业语言迈进,虽然 R 仍受限于当公司需要制造大规模的产品时,而有的人说他被其他语言篡夺地位了。

  “R 更有用的是在画图,而不是建模。”顶尖数据分析公司 Metamarkets 的 CEO,Michael Driscoll 表示,
“你不会在 Google 的网页排名核心或是 Facebook 的朋友们推荐算法时看到 R 的踪影,工程师会在 R 里建立一个原型,然后再到 Java 或 Python 里写模型语法”。

  举一个使用 R 很有名的例子,在 2010 年时,Paul Butler 用 R 来建立 Facebook 的世界地图,证明了这个语言有多丰富多强大的可视化数据能力,虽然他现在比以前更少使用 R 了。

  “R 已经逐渐过时了,在庞大的数据集底下它跑的慢又笨重”Butler 说。

  所以接下来他用什么呢?

http://techorange.com/wp-content/uploads/2014/05/python-logo-master-v3-TM.png

  Python

  如果说 R 是神经质又令人喜爱的 Geek,那 Python 就是随和又好相处的女生。

  Python 结合了 R 的快速、处理复杂数据采矿的能力以及更务实的语言等各个特质,迅速地成为主流,Python 比起 R,学起来更加简单也更直观,而且它的生态系统近几年来不可思议地快速成长,在统计分析上比起 R 功能更强。

  Butler 说,“过去两年间,从 R 到 Python 地显著改变,就像是一个巨人不断地推动向前进‘。

  在数据处理范畴内,通常在规模与复杂之间要有个取舍,而 Python 以折衷的姿态出现。IPythonNotebook(记事本软件)和 NumPy 被用来暂时存取较低负担的工作量,然而 Python 对于中等规模的数据处理是相当好的工具;Python 拥有丰富的资料族,提供大量的工具包和统计特征。

  美国银行用 Python 来建立新产品和在银行的基础建设接口,同时也处理财务数据,“Python 是更广泛又相当有弹性,所以大家会对它趋之若鹜。”O’Donnell 如是说。

  然而,虽然它的优点能够弥补 R 的缺点,它仍然不是最高效能的语言,偶尔才能处理庞大规模、核心的基础建设。Driscoll 是这么认为的。

  Julia

  今日大多数的数据科学都是透过 R、Python、Java、Matlab 及 SAS 为主,但仍然存在着鸿沟要去弥补,而这个时候,新进者 Julia 看到了这个痛点。

  Julia 仍太过于神秘而尚未被业界广泛的采用,但是当谈到它的潜力足以抢夺 R 和 Python 的宝座时,数据黑客也难以解释。原因在于 Julia 是个高阶、不可思议的快速和善于表达的语言,比起 R 要快的许多,比起 Python 又有潜力处理更具规模的数据,也很容易上手。

  “Julia 会变的日渐重要,最终,在 R 和 Python 可以做的事情在 Julia 也可以”。Butler 是这么认为的。

  就现在而言,若要说 Julia 发展会倒退的原因,大概就是它太年轻了。Julia 的数据小区还在初始阶段,在它要能够和 R 或 Python 竞争前,它还需要更多的工具包和软件包。

  Driscoll 说,它就是因为它年轻,才会有可能变成主流又有前景。

/uploadImages/2014/211/A4QCXC828LU7.jpg

   Java

  Driscoll 说,Java 和以 Java 为基础的架构,是由硅谷里最大的几家科技公司的核心所建立的,如果你从 Twitter、Linkedin 或是 Facebook 里观察,你会发现 Java 对于所有数据工程基础架构而言,是非常基础的语言。

  Java 没有和 R 和 Python 一样好的可视化功能,它也不是统计建模的最佳工具,但是如果你需要建立一个庞大的系统、使用过去的原型,那 Java 通常会是你最基的选择。

   Hadoop and Hive

  为了迎合大量数据处理的需求,以 Java 为基础的工具群兴起。Hadoop 为处理一批批数据处理,发展以 Java 为基础的架构关键;相较于其他处理工具,Hadoop 慢许多,但是无比的准确和可被后端数据库分析广泛使用。和 Hive 搭配的很好,Hive 是基于查询的架构下,运作的相当好。

  Scala

  又是另一个以 Java 为基础的语言,和 Java 很像,对任何想要进行大规模的机械学习或是建立高阶的算法,Scala 会是逐渐兴起的工具。它是善于呈现且拥有建立可靠系统的能力。

  “Java 像是用钢铁建造的;Scala 则是让你能够把它拿进窑烤然后变成钢的黏土”Driscoll 说。

  Kafka and Storm

  说到当你需要快速的、实时的分析时,你会想到什么?Kafka 将会是你的最佳伙伴。其实它已经出现五年有了,只是因为最近串流处理兴起才变的越来越流行。

  Kafka 是从 Linkedin 内诞生的,是一个特别快速的查询讯息系统。Kafka 的缺点呢?就是它太快了,因此在实时操作时它会犯错,有时候会漏掉东西。

  鱼与熊掌不可兼得,「必须要在准确度跟速度之间做一个选择」,Driscoll 说。所以全部在硅谷的科技大公司都利用两个管道:用 Kafka 或 Storm 处理实时数据,接下来打开 Hadoop 处理一批批处理数据系统,这样听起来有点麻烦又会有些慢,但好处是,它非常非常精准。

  Storm 是另一个从 Scala 写出来的架构,在硅谷逐渐大幅增加它在串流处理的受欢迎程度,被 Twitter 并购,这并不意外,因为 Twitter 对快速事件处理有极大的兴趣。

http://techorange.com/wp-content/uploads/2014/05/MATLABlog-550x338.png

   Matlab

  Matlab 可以说是历久不衰,即使它标价很高;在非常特定的利基市场它使用的相当广泛,包括密集的研究机器学习、信号处理、图像辨识等等。

   Octave

  Octave 和 Matlab 很像,除了它是免费的之外。然而,在学术信号处理的圈子,几乎都会提到它。

   GO

  GO 是另一个逐渐兴起的新进者,从 Google 开发出来的,放宽点说,它是从 C 语言来的,并且在建立强大的基础架构上,渐渐地成为 Java 和 Python 的竞争者。

  这么多的软件可以使用,但我认为不见得每个都一定要会才行,知道你的目标和方向是什么,就选定一个最适合的工具使用吧!可以帮助你提升效率又达到精准的结果。


推荐阅读
  • 从0到1搭建大数据平台
    从0到1搭建大数据平台 ... [详细]
  • Python 数据可视化实战指南
    本文详细介绍如何使用 Python 进行数据可视化,涵盖从环境搭建到具体实例的全过程。 ... [详细]
  • 在2019中国国际智能产业博览会上,百度董事长兼CEO李彦宏强调,人工智能应务实推进其在各行业的应用。随后,在“ABC SUMMIT 2019百度云智峰会”上,百度展示了通过“云+AI”推动AI工业化和产业智能化的最新成果。 ... [详细]
  • Presto:高效即席查询引擎的深度解析与应用
    本文深入解析了Presto这一高效的即席查询引擎,详细探讨了其架构设计及其优缺点。Presto通过内存到内存的数据处理方式,显著提升了查询性能,相比传统的MapReduce查询,不仅减少了数据传输的延迟,还提高了查询的准确性和效率。然而,Presto在大规模数据处理和容错机制方面仍存在一定的局限性。本文还介绍了Presto在实际应用中的多种场景,展示了其在大数据分析领域的强大潜力。 ... [详细]
  • 2012年9月12日优酷土豆校园招聘笔试题目解析与备考指南
    2012年9月12日,优酷土豆校园招聘笔试题目解析与备考指南。在选择题部分,有一道题目涉及中国人的血型分布情况,具体为A型30%、B型20%、O型40%、AB型10%。若需确保在随机选取的样本中,至少有一人为B型血的概率不低于90%,则需要选取的最少人数是多少?该问题不仅考察了概率统计的基本知识,还要求考生具备一定的逻辑推理能力。 ... [详细]
  • 字节跳动深圳研发中心安全业务团队正在火热招募人才! ... [详细]
  • 作为140字符的开创者,Twitter看似简单却异常复杂。其简洁之处在于仅用140个字符就能实现信息的高效传播,甚至在多次全球性事件中超越传统媒体的速度。然而,为了支持2亿用户的高效使用,其背后的技术架构和系统设计则极为复杂,涉及高并发处理、数据存储和实时传输等多个技术挑战。 ... [详细]
  • HBase在金融大数据迁移中的应用与挑战
    随着最后一台设备的下线,标志着超过10PB的HBase数据迁移项目顺利完成。目前,新的集群已在新机房稳定运行超过两个月,监控数据显示,新集群的查询响应时间显著降低,系统稳定性大幅提升。此外,数据消费的波动也变得更加平滑,整体性能得到了显著优化。 ... [详细]
  • 深入解析十大经典排序算法:动画演示、原理分析与代码实现
    本文深入探讨了十种经典的排序算法,不仅通过动画直观展示了每种算法的运行过程,还详细解析了其背后的原理与机制,并提供了相应的代码实现,帮助读者全面理解和掌握这些算法的核心要点。 ... [详细]
  • 本文详细介绍了Java代码分层的基本概念和常见分层模式,特别是MVC模式。同时探讨了不同项目需求下的分层策略,帮助读者更好地理解和应用Java分层思想。 ... [详细]
  • 网站访问全流程解析
    本文详细介绍了从用户在浏览器中输入一个域名(如www.yy.com)到页面完全展示的整个过程,包括DNS解析、TCP连接、请求响应等多个步骤。 ... [详细]
  • MySQL的查询执行流程涉及多个关键组件,包括连接器、查询缓存、分析器和优化器。在服务层,连接器负责建立与客户端的连接,查询缓存用于存储和检索常用查询结果,以提高性能。分析器则解析SQL语句,生成语法树,而优化器负责选择最优的查询执行计划。这一流程确保了MySQL能够高效地处理各种复杂的查询请求。 ... [详细]
  • 第二章:Kafka基础入门与核心概念解析
    本章节主要介绍了Kafka的基本概念及其核心特性。Kafka是一种分布式消息发布和订阅系统,以其卓越的性能和高吞吐量而著称。最初,Kafka被设计用于LinkedIn的活动流和运营数据处理,旨在高效地管理和传输大规模的数据流。这些数据主要包括用户活动记录、系统日志和其他实时信息。通过深入解析Kafka的设计原理和应用场景,读者将能够更好地理解其在现代大数据架构中的重要地位。 ... [详细]
  • 美团优选推荐系统架构师 L7/L8:算法与工程深度融合 ... [详细]
  • 在前一篇文章《Hadoop》系列之“踽踽独行”(二)中,我们详细探讨了云计算的核心概念。本章将重点转向物联网技术,全面解析其基本原理、应用场景及未来发展前景。通过深入分析物联网的架构和技术栈,我们将揭示其在智能城市、工业自动化和智能家居等领域的广泛应用潜力。此外,还将讨论物联网面临的挑战,如数据安全和隐私保护等问题,并展望其在未来技术融合中的重要角色。 ... [详细]
author-avatar
手机用户2602905667
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有