如何制作一个伟大的R可重复示例

在与同事讨论绩效、教学、发送错误报告或搜索邮件列表和Stack Overflow上的指导时，经常会询问一个可重复的示例，并且总是很有用。

你有什么建议来创建一个优秀的例子？如何以文本格式粘贴r中的数据结构？您还应包括哪些其他信息？

除了使用dput（）、dump（）或structure（）之外，还有其他技巧吗？什么时候应该包含library（）或require（）语句？除了c、df、data等之外，应该避免哪些保留字。？

如何做出一个伟大的、可重复的例子？

当前回答

要快速创建数据的dput，只需将数据复制到剪贴板，然后在R中运行以下命令：

对于Excel中的数据：

dput(read.table("clipboard", sep="\t", header=TRUE))

对于.txt文件中的数据：

dput(read.table("clipboard", sep="", header=TRUE))

如果需要，可以更改后者中的sep。当然，只有当您的数据在剪贴板中时，这才有效。

2013-04-10 14:51:08

其他回答

R-help邮件列表有一个发布指南，包括提问和回答问题，包括生成数据的示例：

示例：有时提供一个小例子实际上可以运行。例如：如果我有如下矩阵x：

  > x <- matrix(1:8, nrow=4, ncol=2,
                dimnames=list(c("A","B","C","D"), c("x","y"))
  > x
    x y
  A 1 5
  B 2 6
  C 3 7
  D 4 8
  >

如何将其转换为数据帧具有8行和3列“row”、“col”和“value”，它们具有维度名称为“row”和“col”的值，如下所示：

  > x.df
     row col value
  1    A   x      1

...（答案可能是：

  > x.df <- reshape(data.frame(row=rownames(x), x), direction="long",
                    varying=list(colnames(x)), times=colnames(x),
                    v.names="value", timevar="col", idvar="row")

)

“小”这个词特别重要。您应该以最小的可重复示例为目标，这意味着数据和代码应该尽可能简单地解释问题。

编辑：漂亮的代码比难看的代码更容易阅读。使用样式指南。

2011-05-11 13:17:38

如果您有一个大数据集，无法使用dput（）轻松放入脚本，请将数据发布到pastebin并使用read.table加载它们：

d <- read.table("http://pastebin.com/raw.php?i=m1ZJuKLH")

灵感来自Henrik。

2014-01-03 19:07:03

以下是我的一些建议：

尝试使用默认的R数据集如果您有自己的数据集，请将其包含在dput中，这样其他人可以更轻松地帮助您除非确有必要，否则不要使用install.package（），人们会理解您是否只使用require或library尽量简明扼要，有一些数据集尽量简单地描述您需要的输出问问题之前自己做上传图片很容易，所以如果你有还包括您可能遇到的任何错误

所有这些都是可复制示例的一部分。

2016-04-09 18:15:19

如果您的数据中有一个或多个因子变量，您希望使用dput（head（mydata））进行复制，请考虑向其添加droplevel，以便最小化数据集中不存在的因子级别不包含在dput输出中，以使示例最小化：

dput(droplevels(head(mydata)))

2015-01-09 15:09:51

有时，无论你如何努力，问题真的无法用较小的数据块再现，而且合成数据也不会发生（尽管展示你是如何生成没有再现问题的合成数据集是有用的，因为它排除了一些假设）。

可能需要将数据发布到web某处并提供URL。如果数据不能向公众公开，但可以共享，那么您可以通过电子邮件将其发送给感兴趣的各方（尽管这将减少需要处理的人数）。我实际上还没有看到这样做，因为无法发布数据的人对以任何形式发布数据都很敏感，但在某些情况下，如果数据在某种程度上被充分匿名/加扰/轻微损坏，人们仍然可以发布数据。

如果你不能做到这两个，那么你可能需要聘请一位顾问来解决你的问题。。。

编辑：匿名/加扰的两个有用SO问题：

如何从私有数据创建示例数据集（用无信息的占位符替换变量名称和级别）？给定一组从连续单变量分布中抽取的随机数，找到分布

2011-07-14 19:49:15

如何制作一个伟大的R可重复示例

推荐文章

最新文章

标签