热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

Rpurrr(二)

在接下来,我们将学习和使用purrr包,它提供的很多函数可以替代很多常见的for循环的应用。R基础包的应用函数组(apply,lapply,tapply等)也可以完成类似的任务,但

在接下来,我们将学习和使用purrr包,它提供的很多函数可以替代很多常见的for循环的应用。R基础包的应用函数组(apply, lapply, tapply等)也可以完成类似的任务,但是purrr包的函数更一致,也更利于学习。

使用purrr函数代替for循环的目的是将常见的列表的处理问题分解为独立的几个部分

  • 1 对于列表中的单个元素,你能找到解决问题的方法吗?如果找到了解决方法,那么你就可以使用purrr将这种方法拓展到列表中的所有元素
  • 2 如果你面临着非常复杂的问题,那么如何将它们几个可行的子问题,然后循序渐进的解决,直至完成最终的解决方案?使用purrr,你可以解决很多子问题,然后通过管道操作将这些问题的结果组合起来。
映射函数

我们在R里面的进行的for循环,通常是先对向量进行循环,然后对其每个元素进行一番处理,最后保存结果。,这种模式太普遍,purrr包提供了一系列的函数来完成这种操作。每种类型的输出都有一个相应的函数。

  • map()输出列表 list
  • map_lgl()输出逻辑型向量 vector
  • map_int() 输出整型向量 vector
  • map_dbl() 输出双精度型向量 vector
  • map_chr() 输出字符型向量 vector
    每个函数都使用一个向量作为输入,并对向量的每个元素应用一个函数,然后返回和输入向量相同的长度的一个新向量。向量的类型由映射函数的后缀决定。

一旦掌握了这些函数,你就会发现可以在解决迭代问题时节省大量时间。但你无须因为使用了for循环,没有使用映射函数而感到内疚。映射函数是一个高度抽象,需要花费很长时间才能理解其工作原理。重要的事情的是解决遇到的问题,而不是写出最优雅的代码(尽管肯定也要为之努力)
可能有些人会说,不要使用for循环,因为它们很慢,这些人完全错了!(因为for循环已经很多年都不慢了)。 使用map()函数的主要优势不是速度,而是简洁:它们可以让你的代码更易编写,也更易读。

因此,我们可以改写for循环的操作。因为那些函数返回的为双精度数,所以我们需要使用map_dbl()函数.

  • map_dbl(df, mean)
  • map_dbl(df, median)
  • map_dbl(df, sd)
    映射函数的重点是需要map匹配的函数,该函数也就是我们需要进行的操作。

如果使用管道工具,这一点就更加明显

  • df %>% map_dbl(mean)
  • df %>% map_dbl(median)
  • df %>% map_dbl(sd)
    map_*系列函数与for循环函数具有以下区别:
  • 所有的purrr函数均是用C实现的,这使得他们的速度非常快。
  • 第二个参数(.f ,是要应用的函数),可以是一个公式、一个字符向量或一个整型向量
  • map_*() 使用…向.f传递一些附加参数,供其每次调用时使用。

插播体会group_by函数和split函数区别
split函数返回的对象为各个分类对象组成的list对象,而purrr通常要求输入对象为list。因此,split分组函数常和purrr函数搭配

切分变量函数中, 必须加上mtcars$或者用.$,否则会报错

mtcars%>%
split(mtcars$cyl)
# 切分变量函数中, 必须加上mtcars,否则会报错

《R purrr(二)》 image.png

如下:该结果必须要由list来接受output

mtcars%>%
split(.$cyl) %>%
map(function(df) lm(mpg~wt, data=df))

《R purrr(二)》 image.png

因为R中创建匿名函数的语法比较繁琐,所以purrr提供了一种更加方便的快捷方式——单侧公式:

mtcars%>%
split(.$cyl) %>%
map(~lm(mpg~wt, data=.))

我们在上面使用了.作为一个代词:它表示当前的列表元素(与for循环中用i表示当前索引是一样的)

当检查多个模型时,有时你会需要提取出像R方这样的摘要统计量。要想完成这个任务,需要先运行summary()函数,然后提取结果中r.squared. 我们可以使用匿名函数的快捷方式来完成这个操作.

models=mtcars%>%
split(.$cyl) %>%
purrr::map(~lm(wt~mpg,data=.))
models%>%
purrr::map(summary)%>%
purrr::map_dbl(~.$r.squared)

因为提取命名成分的这种操作十分常见,所以purrr提供了一种更为简洁的快捷方式:使用字符串

models%>%
purrr::map(summary)%>%
purrr::map_dbl("r.squared")

当输入对象为data.frame时,每一列为一个变量,相当于for循环中的i

例如:计算iris中每列唯一值的数量


iris%>%
map(function(df) length(unique(df)))
iris%>%
map_df(~length(unique(.)))

To generate 10 random normals for each of μ=−10, 0, 10, and 100: The result is a list of numeric vectors.
使用单侧函数,前面一定要加~,每次输入的数据集用.

map(c(-10,0,10,100),~rnorm(n=10,mean = .))
map(c(-10,0,10,100),function(x) rnorm(n=10,mean = x))

判断类型 map_lgl

判断每一列是否为因子型变量

map_lgl(iris ,is.factor)
iris%>%map_lgl(is.factor)

《R purrr(二)》 image.png

映射函数可以处理任何向量,而不仅仅是列表。与列表一样,映射函数将对向量的每个元素应用该函数。通常选择输入对象为list
The expression map(1:5, runif) is equivalent to running runif(1), runif(2), …, runif(5), and collecting the results in a list. The result is a length five list with numeric vectors of sizes one through five。

What does map(-2:2, rnorm, n = 5) do? Why?
What does map_dbl(-2:2, rnorm, n = 5) do? Why?

《R purrr(二)》 image.png

这是因为map_dbl希望应用于每个元素的函数返回长度为1的数字向量。而我们这个函数输入为一个元素的时候返回的为5个元素,必须要用list来接受,用其他的必须保证输出的为长度为一的对象。所以,下面的就可以了

《R purrr(二)》 image.png

如果我们想要一个数值向量,可以使用map(),然后使用flatten_dbl()

flatten_dbl(map(-2:2, rnorm, n = 5))

推荐阅读
  • 本文将继续探讨 JavaScript 函数式编程的高级技巧及其实际应用。通过一个具体的寻路算法示例,我们将深入分析如何利用函数式编程的思想解决复杂问题。示例中,节点之间的连线代表路径,连线上的数字表示两点间的距离。我们将详细讲解如何通过递归和高阶函数等技术实现高效的寻路算法。 ... [详细]
  • 深入理解排序算法:集合 1(编程语言中的高效排序工具) ... [详细]
  • 分享一款基于Java开发的经典贪吃蛇游戏实现
    本文介绍了一款使用Java语言开发的经典贪吃蛇游戏的实现。游戏主要由两个核心类组成:`GameFrame` 和 `GamePanel`。`GameFrame` 类负责设置游戏窗口的标题、关闭按钮以及是否允许调整窗口大小,并初始化数据模型以支持绘制操作。`GamePanel` 类则负责管理游戏中的蛇和苹果的逻辑与渲染,确保游戏的流畅运行和良好的用户体验。 ... [详细]
  • 本文详细探讨了使用纯JavaScript开发经典贪吃蛇游戏的技术细节和实现方法。通过具体的代码示例,深入解析了游戏逻辑、动画效果及用户交互的实现过程,为开发者提供了宝贵的参考和实践经验。 ... [详细]
  • 每年,意甲、德甲、英超和西甲等各大足球联赛的赛程表都是球迷们关注的焦点。本文通过 Python 编程实现了一种生成赛程表的方法,该方法基于蛇形环算法。具体而言,将所有球队排列成两列的环形结构,左侧球队对阵右侧球队,首支队伍固定不动,其余队伍按顺时针方向循环移动,从而确保每场比赛不重复。此算法不仅高效,而且易于实现,为赛程安排提供了可靠的解决方案。 ... [详细]
  • Spring框架的核心组件与架构解析 ... [详细]
  • 本文介绍了UUID(通用唯一标识符)的概念及其在JavaScript中生成Java兼容UUID的代码实现与优化技巧。UUID是一个128位的唯一标识符,广泛应用于分布式系统中以确保唯一性。文章详细探讨了如何利用JavaScript生成符合Java标准的UUID,并提供了多种优化方法,以提高生成效率和兼容性。 ... [详细]
  • 本文深入解析了JDK 8中HashMap的源代码,重点探讨了put方法的工作机制及其内部参数的设定原理。HashMap允许键和值为null,但键为null的情况只能出现一次,因为null键在内部通过索引0进行存储。文章详细分析了capacity(容量)、size(大小)、loadFactor(加载因子)以及红黑树转换阈值的设定原则,帮助读者更好地理解HashMap的高效实现和性能优化策略。 ... [详细]
  • 在对WordPress Duplicator插件0.4.4版本的安全评估中,发现其存在跨站脚本(XSS)攻击漏洞。此漏洞可能被利用进行恶意操作,建议用户及时更新至最新版本以确保系统安全。测试方法仅限于安全研究和教学目的,使用时需自行承担风险。漏洞编号:HTB23162。 ... [详细]
  • 深入解析Android 4.4中的Fence机制及其应用
    在Android 4.4中,Fence机制是处理缓冲区交换和同步问题的关键技术。该机制广泛应用于生产者-消费者模式中,确保了不同组件之间高效、安全的数据传输。通过深入解析Fence机制的工作原理和应用场景,本文探讨了其在系统性能优化和资源管理中的重要作用。 ... [详细]
  • 在 Linux 环境下,多线程编程是实现高效并发处理的重要技术。本文通过具体的实战案例,详细分析了多线程编程的关键技术和常见问题。文章首先介绍了多线程的基本概念和创建方法,然后通过实例代码展示了如何使用 pthreads 库进行线程同步和通信。此外,还探讨了多线程程序中的性能优化技巧和调试方法,为开发者提供了宝贵的实践经验。 ... [详细]
  • 在使用SSH框架进行项目开发时,经常会遇到一些常见的问题。例如,在Spring配置文件中配置AOP事务声明后,进行单元测试时可能会出现“No Hibernate Session bound to thread”的错误。本文将详细探讨这一问题的原因,并提供有效的解决方案,帮助开发者顺利解决此类问题。 ... [详细]
  • 深入理解 Java 控制结构的全面指南 ... [详细]
  • HTML 页面中调用 JavaScript 函数生成随机数值并自动展示
    在HTML页面中,通过调用JavaScript函数生成随机数值,并将其自动展示在页面上。具体实现包括构建HTML页面结构,定义JavaScript函数以生成随机数,以及在页面加载时自动调用该函数并将结果呈现给用户。 ... [详细]
  • 通过使用CIFAR-10数据集,本文详细介绍了如何快速掌握Mixup数据增强技术,并展示了该方法在图像分类任务中的显著效果。实验结果表明,Mixup能够有效提高模型的泛化能力和分类精度,为图像识别领域的研究提供了有价值的参考。 ... [详细]
author-avatar
mobiledu2502927267
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有