Ghost in the data

RSS: https://ghostinthedata.info/index.xml
数据中的幽灵——数据科学与分析的探索。

风格不是技能:Bruce Lee的自信来自刻意练习,而非天赋

很多人看到高手的自信表现,会归因于天赋而非背后的大量刻意练习——用"他是Bruce Lee"来给自己找借口。文章以Bruce Lee早年经历为例,指出他成名前的挣扎:1964年地下比武、在朋友家教拳、做配角、戴护腰训练。 核心观点:真正的自信来自把大量精力投入一件事,无法伪装,也无法用"天赋"来逃避努力。
评论点赞收藏30 天前

AWS MWAA: The Practitioner's Unvarnished Guide

I remember the first time I sat down properly with the Step Functions architecture our team inherited. Someone had designed it thoughtfully — real engineering thought had gone into it when it was buil...
评论点赞收藏74 天前

Data Engineers: Just Do Code Reviews

In Code Complete, Steve McConnell writes: Software testing alone has limited effectiveness — the average defect detection rate is only 25 percent for unit testing, 35 percent for function testing, and...
评论点赞收藏81 天前

你无法激励一条从未出错的管道

数据工程中最有价值的维护工作往往是隐形的。将激励与指标挂钩不仅无法揭示这些工作,反而可能掩盖它们。核心观点是:不能为不会出错的管道设计激励机制,因为预防性工作的价值难以量化。 这挑战了传统的KPI导向管理思维,适合对工程管理和团队激励感兴趣的技术人员思考。
评论点赞收藏88 天前

你的团队已有模式,只是尚未察觉

数据工程团队其实已经拥有了解决问题的模式,只是缺乏共享词汇来识别它们。建立“模式库”可以帮助团队统一语言并提升估算信心。关键在于协作构建,避免将其变成官僚主义的负担。 这是一个关于团队知识沉淀和工程效率的实用建议,适合技术管理者参考。
评论点赞收藏95 天前

Keep Moving

Why forward momentum — not planning, not tooling, not the perfect architecture — is the only thing that actually ships a data platform.
评论点赞收藏99 天前

AI无法复制的竞争护城河

<p>在这样一个竞相实现每一种交互自动化的世界里,那些致力于建立真正人类联结的组织,正悄然打造着一项算法无法复制的事物。</p>
评论点赞收藏105 天前

SQL告诉你做什么,注释告诉你为什么

探讨SQL作为声明式语言只能告诉人们“做什么”,而无法表达“为什么做”的局限性,强调在数据工程中注释对于传达业务意图和设计理由的重要性。
评论点赞收藏116 天前

数据工程的五个世界

提出数据工程存在五种不同的世界:现代分析商店、企业遗留系统、产品引擎、受监管管道和内部平台,每种环境遵循不同规则,通用建议往往只适用于其中一种。
评论点赞收藏151 天前

别再从零开始构建Salesforce集成

Hands-on guide to using Snowflake's OpenFlow Salesforce connector, arguing that managed connectors are superior to custom code due to features like schema evolution.
评论点赞收藏179 天前

数据模型没坏,只是旧了:为什么重构优于重建

文章强烈反对数据团队因代码混乱而进行整体重建(Rewrite),主张渐进式重构(Refactoring)。作者以Netscape重写浏览器导致市场丢失的历史教训开篇,指出旧代码中的“脏逻辑”往往是处理生产环境边缘案例和业务规则的“战斗疤痕”,蕴含着无法文档化的隐性知识。 文章引用Fred Brooks的“第二系统效应”和规划谬误,解释为何重建项目往往延期且失败。核心观点是:数据模型的复杂性大多源于业务本质(Essential Complexity),而非工程失误。 盲目重建不仅无法消除复杂性,还会丢失宝贵的制度记忆。建议采用类似Strangler Fig模式的渐进式重构,在保留现有功能的同时逐步优化架构。
评论点赞收藏187 天前

你不需要许可来修复你的数据

为初级数据工程师提供五种经过实战检验的策略,使其无需等待授权即可改善数据质量,并引用Airbnb、Google等公司的真实案例作为支持。
评论点赞收藏193 天前

朋友会在那里,但你的工作不会

引用成人幸福感最长研究,指出人际关系比职业成就更重要,但现代人常因工作牺牲朋友聚会。文章探讨了这种选择的代价及真正友谊的样子。 属于生活感悟类,对高压的技术人群有情感共鸣,但技术讨论价值较低。
评论点赞收藏196 天前

迈向更好数据工程的12个步骤

提供一个包含12个是非题的快速评分框架,用于评估数据团队的工程成熟度,并结合dbt、Snowflake、GitHub Actions和AWS给出具体基准。
评论点赞收藏207 天前

没人写的CSV测试套件

指导如何将RFC 4180标准和现实世界的边缘案例转化为具体的测试套件,以便在数据管道处理前捕获CSV问题,对生产者和消费者都有实用价值。
评论点赞收藏210 天前

在 Snowflake 中基于 Iceberg 表的 WAP 模式实战

介绍在 Snowflake 中使用 Apache Iceberg 表实现 WAP (Write-Audit-Publish) 模式的实操教程。重点在于利用分支功能进行数据质量检查,并通过零 I/O 的发布步骤确保生产环境安全。 适合关注数据仓库工程和变更安全的工程师。
评论点赞收藏215 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。