数据工程博客

RSS: https://ssp.sh/index.xml
数据生态系统的真实新闻。

我的终端工作流:笔记、数据工程与写作(Linux/macOS)

数据工程师兼写作者分享其终端工作流:Linux用Omarchy、macOS用Yabai+skhd做平铺窗口管理;用Neovim+Obsidian写作用Vim motions;数据库查询用vim-dadbod;笔记用Zettelkasten+PKM工作流。作者最终选择单屏+虚拟桌面方案,用Super键快速切换不同用途桌面。
评论点赞收藏4 天前

迷你退休:人生阶段之间的短暂休整

在学业、换工作或人生阶段转换时,用1-3个月的"迷你退休"代替长假,通过散步、接触自然等方式彻底断开工作。DHH的37Signals每几年给员工额外休假,设计师Stefan Sagmeister称自己最好的想法来自一年休假。Steve Jobs的"连点成线"理论被引用为支持这一做法的核心论据。
评论点赞收藏11 天前

对算法和Spotify都厌倦了:自建本地音乐库并导出播放列表

作者买了Ugreen Server自建本地音乐库,用Strawberry Music Player播放MP3,通过Exportify导出Spotify播放列表和喜欢歌曲,附带Jupyter Notebook分析音乐品味。文章提到Mary Spender离开Spotify的视频,认为未来会有更多人转向购买并拥有音乐文件,而非依赖算法推荐。
评论点赞收藏12 天前

我的公开第二大脑——660条笔记,15年,开源

我是作者。~660张笔记,来自私人黑曜石 8,360字的宝库(300万字)。大约在2011年开始用OneNote, 2021年搬到Obsidian[1],导入了所有内容 Python 脚本 [2]。 笔记会随着时间累积,这就是我的写作来源 来自。语义层笔记始于2022年,后来成为 四部分的博客系列,然后是我书中的一章。具象化 视图、一大表、数据库分析和OLAP都是独立的笔记 相隔多年。后来我才注意...
评论点赞收藏13 天前

书籍推荐与读书笔记

数据工程师整理2022至2026年阅读书单,涵盖Stewart Brand《万物维护》、Cal Newport《慢生产力》、Isaacson《马斯克传》等,每本附简短个人评价。
评论点赞收藏17 天前

GoatCounter:开源隐私友好型网页分析工具的技术实现与访问计数逻辑

GoatCounter 是一个开源的网页分析平台,以捐赠支持或自托管方式提供,主打隐私保护,替代 Google Analytics、Matomo 等工具。它统计“访问次数”而非“页面浏览量”,同一会话内多次加载只计一次访问,避免刷新干扰数据。 技术细节上,它通过 siteID + User-Agent + IP 生成 session_key,内存中维护 8 小时会话映射,用 UUIDv4 标识用户路径,IP 和 UA 不持久化存储,无法反向追踪。伪代码清晰展示访问判断逻辑:新会话或新路径才触发计数器递增。适合关注隐私、希望透明统计逻辑的开发者和小型站点运营者。
评论点赞收藏19 天前

如何基于第二大脑和 Bluesky 动态自动化生成 Newsletter

作者分享了一套基于 Python 脚本的个人 Newsletter 自动化采集方案。该方案从 Second Brain 笔记库、阅读记录和 Bluesky 动态中自动抓取更新,生成 Markdown 草稿供人工编辑,最终通过 Listmonk 发送。设计强调“无 AI 介入”以保持个人声音,并利用 Git 日志行数过滤微小修改,通过 DuckDB 查询 Bluesky 接口获取热门帖子。
评论点赞收藏24 天前

创作的行为与结果

创造,是追寻自我的终极方式;在与世界共享时,我们赋予世界以温暖与力量,并运用潜意识的力量。它带给我们喜悦与爱,对每一位艺术家而言,这正是至高无上的“流动”之境——一种幸福的境界。 创造之行 创造的过程,是一种宣泄的方式。当我们从无到有创造出某物时,这种过程会带给我们无尽的喜悦。像孩子般心怀好奇,尽情探索自己的思绪,任由其自由流淌——正如毕加索所言:“如果他事先知道画作的最终结果,便绝不会费心去开始...
评论点赞收藏32 天前

数据语法学:定义一次,跨引擎随处运行

介绍 xorq 如何通过 Ibis 表达式实现数据工程的“定义一次,到处运行”。它利用 Git 管理状态,支持在 DuckDB、Postgres 等不同引擎间无缝切换数据流,并生成可复现的 YAML 清单。适合关注数据栈解耦、跨引擎执行效率及 AI Agent 数据上下文化处理的工程师。
评论点赞收藏39 天前

AI Agent在数据工程中的定位:构建正确性层

提出数据工程中AI Agent的三层架构,强调用确定性核心(如Rust引擎)处理SQL验证,而非完全依赖LLM。结合Altimate Code案例,演示了自动化的爆炸半径分析,解决数据变更时的下游影响评估问题。适合关注数据管道可靠性与AI工程落地的工程师。
评论点赞收藏39 天前

助你保持专注的音乐

整理了几款基于神经科学的专注音乐服务(如Focus@Will,)和无歌词歌单,适合需要背景音辅助深度工作的人。文中还提及了CGP Grey的工作法,即通过走动改变环境来维持生产力。
评论点赞收藏40 天前

智能笔记流程:连接札记法与纯文本的所有权

作者基于17年笔记经验,分享从OneNote迁移至Obsidian加纯文本Markdown的工作流。核心观点是“写作是思考的媒介”,主张用双向链接替代文件夹,并通过Hugo静态站实现笔记与博客发布的自动化同步,强调数据所有权和减少摩擦。
评论点赞收藏48 天前

数据编排运维实战:DevOps、基础设施与代码位置的最佳实践

深入探讨数据编排层的运维最佳实践,重点解决 DevOps 与 GitOps 在数据工程中的落地问题。文章详细拆解了基础设施代码与业务逻辑的分离策略,特别是利用 Dagster 的 Code Locations 实现状态与无状态组件的有效连接。提供了关于多环境部署、成本观测(FinOps)、数据治理及测试的具体操作指南,适合负责构建和维护大规模数据平台的工程师参考。
评论点赞收藏50 天前

我的网站作为一个连通图:博客、第二大脑与书籍

作者将博客、笔记库(Second Brain)和书籍整合为一个可视化的关联图谱,节点可点击跳转至底层笔记。其基于 Quartz 构建的开源项目已公开。对于关注个人知识管理(PKM)、Obsidian 生态及静态网站构建的技术读者,提供了具体的工程实现参考和交互设计思路。
评论点赞收藏50 天前

数据工程并购全景:2022-2026年整合趋势回顾

梳理了2022至2026年间数据工程领域的并购整合动态,涵盖SAP收购Dremio、IBM收购Confluent、Databricks收购MosaicML等关键案例,反映出现代数据栈向统一平台集中、AI与实时数据处理深度融合的趋势。
评论点赞收藏58 天前

平凡的生活,以及一种可能看起来很无聊的美好生活

文章探讨了“无聊”生活的价值,认为单调重复的日常(如作家生活)可能是最幸福的。作者主张回归“单一功能设备”和“本地优先”软件,以摆脱算法控制和大公司的监控。核心观点是:拥抱无聊和发呆能治愈精神状态,恢复直觉,这种“无聊”正成为一种新的奢侈。
评论点赞收藏60 天前

博客的未来在于互联互通:以动态笔记驱动静态博客

作者提出博客的未来在于与持续更新的笔记(Notes)相互连接。核心观点是:一次性发布的传统博客容易过时,而像Obsidian这样的笔记可以作为动态的知识库(第二大脑)。通过在博客中引用笔记链接,可以实现内容的自动同步更新,避免平台锁定。文章强调了Markdown和去中心化网络(如IndieWeb、AT Protocol)在构建长期、互联的个人知识体系中的优势,并分享了使用Quartz等工具搭建个人数字花园的实践方法。
评论点赞收藏64 天前

就在身边旅行:随性探索本地未知的乐趣

作者Derek Sivers提倡一种随性的本地旅行方式:不制定详细计划,凭直觉和运气探索居住地附近几公里内的未知角落。文章分享了他在瑞士与家人驾车随机发现森林、艺术装置和雪景的经历,强调这种“微冒险”能带来放松和新奇感。文中还引用了Hacker News上的讨论,指出世界各地(如吉尔吉斯斯坦、日本等)都有类似瑞士的风景,只要避开热门景点跟随本能,就能发现惊喜。最后提到哲学家康德因坚持严格作息而几乎不出远门,侧面印证了本地深耕的价值。
评论点赞收藏65 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。