Notes from a data witch

RSS: https://blog.djnavarro.net/index.xml
Danielle Navarro 的数据科学博客,关于统计学、R 语言与数据可视化。

R语言绘图与表格中的Markdown样式应用

介绍如何在R语言的图表和表格中使用Markdown样式进行排版。对于需要处理复杂数据可视化或报告生成的R语言开发者来说,这是一个实用的技巧补充。内容偏向具体的工程实现细节,适合有特定排版需求的垂直人群。
评论点赞收藏44 天前

线性余弦调色板

统计学家兼生成艺术家Danielle Navarro以自嘲"爱写长文"开场,实际交出了一篇短小精悍的实用技术帖:用R语言通过余弦函数生成连续随机调色板。方法本身极其简单——仅需四个基础颜色向量和一条余弦公式,作者提供了可直接运行的R代码和16色输出示例,并展示了如何将调色板接入自己的分形细分(subdivision)和利萨如图形生成艺术系统,附多张视觉效果图。诚实评价"有些很糟,有些很美,多数还行"。全文人味十足,有个人实践、一手代码、真实审美判断和零模板化包装,适合对R语言、数据可视化或生成艺术感兴趣的读者直接复用。
评论点赞收藏72 天前

关于检查 R 会话的一些思考

R 语言知名博主 Danielle Navarro 从一句"2017 年左右才出现的古老谚语"切入,聊检查 R 会话(session)这件事。这不是干巴巴的技术教程,而是带着个人经验和网络社区文化的随笔。作者以数据女巫的独特语气,把编程中的日常习惯写出了人情味和自嘲感。适合 R 用户和关注编程文化的人阅读,既有实用参考价值,也有社区共鸣。
评论点赞收藏222 天前

把 Runkeeper 跑步数据做出真正有趣的可视化

一位热爱跑步也热爱数据分析的博主,受够了 Runkeeper 等跑步 App 千篇一律的步数折线图和路线地图——"充其量只能说无聊"。她决定用自己的方式重新处理跑步记录,做出了比默认报表有意思得多的数据可视化方案。文章来自知名数据科学家 Danielle Navarro 的个人博客,包含具体的方法、代码和可视化成果,既有个人吐槽也有实操干货。适合喜欢跑步、数据可视化或折腾自己数据的读者,看完很可能想动手试一把。
评论点赞收藏223 天前

一台电脑管理两个GitHub账号

个人开发者常因工作和开源项目需要管理多个GitHub账号,作者djnavarro真切地讲述了自己长期被git配置问题困扰的经历,并给出了在单台电脑上区分两个GitHub身份的完整方案。文章从ssh config配置到git条件包含机制,手把手教读者如何让不同仓库自动使用对应账号提交,还穿插了自己的踩坑记录和验证技巧。这是有真实痛点的技术人员写给自己和同类的一篇实用笔记,人味十足,信息密度高,不废话不注水。
评论点赞收藏251 天前

关于调查权重的一些笔记

一篇极其罕见的"人格分裂式"统计学博客——作者(知名统计学家Danielle Navarro)让自己内心的🫀(情感脑)和🧠(理性脑)就调查权重这个话题展开对话。🫀想写一篇关于survey weights的笔记,🧠吐槽说"你确定?咱刚花一个月写完GAMLSS那坨怪物,还写了前传和前前传……"。全文以两个自我互相调侃、拉扯、最终达成共识的形式展开,既有关于加权回归、设计效应等专业内容的硬核讨论,又有作者对自己写作拖延症和完美主义的自嘲。这不是一篇教条式的教程,而是一次活生生的思考过程记录——读者看到的不是结论,而是一个人如何与自己的知识焦虑和表达冲动博弈的真实状态。
评论点赞收藏323 天前

关于概率判断的一些冷思考

数据科学家Navarro指出,一个在社交媒体上反复走红的统计说法——"美国人认为每5人中就有1人是跨性别者"——实际上是错误的,每次传播都让她愤怒。她以这个典型案例切入概率判断的认知框架,解释这类看似惊人的社会统计数据为何容易被大规模误读,以及人们如何更理性地评估调查中的概率陈述。文章融合具体数据推理与强烈的个人立场,兼具社会敏锐度和统计学教育价值。
评论点赞收藏329 天前

GAMLSS、NHANES 与我的数据炼狱

统计学家 Danielle Navarro 以"数据女巫"自居,延续个人博客系列,用一贯的幽默与自嘲口吻继续吐槽统计建模之路——这次轮到了 GAMLSS(广义可加模型位置尺度形状模型)和 NHANES 数据。文章不是冷冰冰的方法教程,而是一段有血有肉的真实踩坑记录:作者带着真实的技术困惑、个人失败经历和独立思考,将复杂统计方法变成了亲切可读的技术叙事。对数据科学从业者来说,这是一份难得的"过来人"经验分享,有态度、有细节、有讨论入口,读来既解渴又有共鸣。不堆砌术语、不卖弄公式,充满人味和求知欲,是典型的高质量个人技术写作。
评论点赞收藏343 天前

样条、B样条、P样条,以及一只不满的小猫

统计学家 Danielle Navarro 用自嘲幽默的方式,从零手写 R 代码实现样条(spline)、B 样条和 P 样条,一路吐槽自己被迫学习这些概念的无奈。文章以分段多项式(piecewise polynomial)为基础,逐步演示了 Cox-de Boer 递归构造 B 样条基函数、最小二乘估计样条参数,并用 ggplot2 的 mpg 数据做了实际拟合。作者坦言对 P 样条毫无兴趣,但为了理解 GAMLSS 框架不得不硬啃——这种"一边学一边骂"的真实感让整篇技术博客有了强烈的人情味。适合对统计模型和 R 编程感兴趣的读者,内容有代码、有数学、有现场踩坑记录,不是枯燥的教科书搬运。
评论点赞收藏344 天前

Box-Cox 幂指数分布

统计学家 Danielle Navarro 以亲身实践的视角,细致讲解 Box-Cox 幂指数分布(BCPE)及其在 GAMLSS 回归框架下的应用。她从自己在药理学建模工作中反复遇到生长曲线拟合问题出发,引出为什么需要 BCPE 这种能同时处理偏度和峰度的灵活分布。文章不仅给出分布的定义与参数含义,还结合实际建模场景讨论其在生长曲线、分位数回归中的价值。全篇保持个人博客特有的坦诚语气,像跟同行聊天一样分享踩坑经验和思考过程,而非冷冰冰的教科书搬运。适合有统计回归基础、对 GAMLSS 或非线性生长建模感兴趣的读者。
评论点赞收藏379 天前

在 R 中动态生成 Quarto 文档语法

从对自己被叫过的各种名字变体(Dan、Dani、Danny、Daniel、Danielle……)的幽默哲学思考切入,一位数据科学家以 babynames 数据集做分析演示,自然引出她开发的 quartose R 包——能在 R 代码块中动态生成 Quarto 文档语法(div、tabset、span、边注、callout 等)。文章展示了具体代码实现与输出效果,讨论 knitr/quarto 协作中 ggplot2 渲染时机等实际技术细节,最后以诚实自省的态度反问:这个小工具对别人真的有用吗?还是只是自己的玩具?全文充满个人风格、有真实困惑、有具体代码和经验分享,读起来既有趣又有收获。
评论点赞收藏407 天前

使用brms实现贝叶斯Emax回归

统计学家Danielle Navarro以亲身实践分享如何在brms框架中实现贝叶斯Emax回归,用于药物暴露-效应(剂量-反应)分析。作者坦诚自己刚进入药物计量学领域不久,带着冒名顶替综合征的诚实感写作,这份真实困惑本身就加分。文章不是空泛的趋势综述,而是手把手走通从模型理解、公式设定到brms代码实现的全流程,附带完整的实用参数配置和诊断建议。适合有贝叶斯基础、想将Emax模型落地到药物研发(如剂量探索、疗效评估)的分析师和研究人员。有具体代码、有方法论、有个人视角,是典型的优质技术博客——信息密度高、可复用、有人的温度。
评论点赞收藏428 天前

用 ggplot2 实现带逐对旋转的散点图矩阵

Danielle Navarro 以招牌幽默笔调分享 ggplot2 高阶用法:实现带交互式逐对旋转(pairwise pivoting)的散点图矩阵,让多变量探索更直观。文章包含完整代码实现、设计思路与踩坑心得,延续「数据魔女」博客一贯的实用+个人风格,面向 R 语言数据可视化爱好者,不是空泛教程而是有真实工程取舍的一手经验。
评论点赞收藏439 天前

好伪随机数也会翻车

统计编程中一个令人抓狂的坑:一位同事设置了 set.seed 以确保随机数可复现,但在不同机器上运行相同的多元正态抽样代码,结果却完全不同——不是微小差异,而是灾难性的完全不同。作者追踪发现,问题根源不在代码或 R 包 (MASS::mvrnorm),而在于浮点数精度对矩阵特征分解的影响。协方差矩阵之间极细微的浮点截断误差(量级 1e-12),会导致 eigendecomposition 结果中特征向量方向反转(符号翻转),进而完全改变后续随机数流的内容。这是数值线性代数中已知但极少被注意的陷阱:在浮点算术世界中,数学上等价的矩阵不一定产生等价的分解结果,而一旦分解被用于随机抽样,种子管理也无能为力。文章以第一人称记录了完整的排查过程,穿插了大量幽默吐槽和 R 代码实验,既是实用避坑指南,也是一篇生动展示"计算机不等于数学"的经典案例。
评论点赞收藏454 天前

不安之心

一首以女性城市安全焦虑为主题的短诗。作者用 Emma 和 Lucy 两个场景的对比——Emma 迷失在陌生街区,处处感到威胁;Lucy 在家门口也时刻警惕,刻意避免形成固定路线——浓缩了女性在公共空间中时时警觉、处处自保的生存状态。诗作没有说教或数据分析,纯以意象和节奏传递情绪,读来安静却有张力。适合对性别议题、城市空间、诗意表达或数据圈写作者个人表达感兴趣的读者。
评论点赞收藏486 天前

关于 targets 的三个短篇故事

一位有血有肉的个人技术博主(Danielle "Data Witch" Navarro)以三则亲身经历的小故事,讲述她如何使用 R 语言 targets 包构建可复现数据分析工作流。延续她之前广受好评的 makefiles 深度系列,这次聚焦于 targets 这个现代数据管道工具:从初次接触时的困惑,到实际项目中遇到的问题与意外发现,再到逐步理解其设计哲学。全文带有鲜明的个人视角和踩坑实录,不是官方文档搬运,而是真实使用者的反思与总结。适合对 R 语言、可复现科研、数据工程管道感兴趣的读者获取一手经验。
评论点赞收藏585 天前

魔法学派

一位资深数据科学家的个人博客,记录她在 2024 年底重拾 Tidy Tuesday 练习时,用 R 语言探索和可视化"魔法学派"主题数据集的过程。文章不是教程,而是真实的心流记录:她为什么喜欢数据整理和可视化、时间总被生活阻隔又偶尔能沉浸其中的满足感,以及面对一个有趣数据集时的探索思路。有个人经验、有审美判断(对可视化的偏好)、有真实的业余数据爱好者的共鸣,没有营销包装或套路写法。
评论点赞收藏592 天前

Art from code VI: Tiles and tessellations

A couple of years ago I gave an invited workshop called art from code at the 2022 rstudio::conf (now posit::conf) conference. As part of the workshop I wrote a lengthy series of notes on how to make g...
评论点赞收藏601 天前

Julia入门基础(编程语言,三篇系列之一)

数据科学家Danielle Navarro以亲身学习经历写下的Julia入门笔记,核心看点是她用多语言背景(R/Python/C++)横向对比Julia的设计哲学,配合真实代码一步步展示变量类型、向量、字典、函数分发、管道操作符和元编程等基础,同时穿插《基地》剧集截图和幽默吐槽,让技术教程充满鲜明的个人观点和审美判断。她讲清楚了Julia为什么1-based索引、如何自动编译达到C++级别性能、多重分发机制怎么用,以及管道设计虽严格但催生函数式思维。全程有可复现的代码块、踩坑记录(比如missing值处理方法)、对语言设计好恶的坦诚表达,还有"hello cruel world"之类的俏皮彩蛋。这不是那种小编体或SEO拼凑的入门教程,而是一个有经验、有态度、有幽默感的程序员在上手新语言时的真实记录,对想了解Julia或看看真正有"人味"的技术博客怎么写的人来说,值得一读。
评论点赞收藏888 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。