数据工程博客

RSS: https://ssp.sh/index.xml
数据生态系统的真实新闻。

问题不在于 AI 代码,而在于现在没有人知道任何东西了

核心观点:AI 生成代码的真正风险不在代码本身,而在于团队对系统架构、设计意图和技术决策逐渐失忆,导致可维护性崩溃。文中引用某大厂工程师吐槽:新入职半天,发现规格、测试、PRD 全由 Claude 生成,没人读代码、没人解决 bug,从 L1 到 L7 都在"和 Claude 聊天",12 小时工作只是按回车。 作者进一步讨论数据工程与 AI 的关系、PM 借助 AI 造产品的隐患,并强调意图、品味、架构设计在 AI 时代更关键,最终挑战是维护性。 "AI 不能自己驱动自己"是仍需要人类编排的信号。文章聚合了多条推文观点加作者评述,观点清晰,有较强讨论入口。
评论点赞收藏2 天前

过去几年使用 AI 工作中学到的四件事

作者自 2015 年开始写作,过去 2-3 年使用 AI 辅助写作后总结四条体会:1)读者是人,内容就应由人来写;2)非自己产生的想法很难写到底;3)现在才开始写的人,读者无法判断其离开 AI 后是否真有写作能力;4)AI 不会取代人类写作,因为写作即思考,AI 无法从个人经验和内心出笔,写出的东西缺乏灵魂。 文中引用了 DuckDB 作者 Hannes Mühleisen 的观点做类比,并链接到其关于"写作即思考"的另一篇文章。整体偏个人反思短文,信息密度中等,观点朴素,争议空间有限。
评论点赞收藏5 天前

把 Omarchy Linux 当主力机用了一年

作者把 Omarchy Linux(基于 Arch)作为日常主力机使用一年多,这篇是系列第三篇,重点讲最新 Quattro 4.0 版本的变化与体验。核心观点:Quattro 引入 Quickshell 统一了栏、启动器、菜单、通知、锁屏等 UI 组件,让原本由多个独立工具拼起来的桌面变成更内聚、更可控的 OS;同时插件市场上线不到一个月已有 3000+ 插件,非技术用户也能让 AI 代理生成自定义工具、主题和工作流,类似在操作系统层做“malleable computer”。 作者还贡献了 Windows VM、时区插件、剪贴板 OCR、截图裁剪等功能,并对比 macOS/Windows 的封闭限制,强调 Omarchy 开箱即用、安装可做到 9 秒、开源社区和 Omacom Foundation 资助 Hyprland/QuickShell 等项目的意义。 适合作为 Omarchy/Arch/Hyprland/开源桌面体验的个人长评,信息量和立场都较强,但也有推广色彩。
评论点赞收藏11 天前

从 Obsidian 个人仓库到企业知识大脑:让 Agent 写、分支、合并

<p>多年来我一直在使用个人第二大脑。我最初用OneNote,后来因为Obsidian的链接功能而转向了Obsidian。从那以后,我为个人生活建立了完整的知识网络,不仅如此:我还用Obsidian管理我的个人业务,比如我的CRM或所有与公司相关的知识。</p><p>但如果你想在更大的公司采用同样的方法,企业规模,内部信息丰富,同时外部也能获取呢?在多位写手、大量用户且始终保持最新的情况下,如何管理知识?<br><br>虽然企业知识管理并不新鲜,但Andrej Karpathy在短短中分享了一个自我策划的大型语言模型维基它迅速走红,展示了小型个人自动更新知识维基的可能性。<br><br>但它在企业级下运行不起作用,而且没有验证流程或版本管理。</p><p>本文将从个人大脑转向企业大脑,展示了功能差异、使这些差异成为可能的原因,以及智能体如何帮助我们不仅读取上下文,还帮助我们编写和更新信息。<br><br>我们探讨智能体如何在自身分支上写入(有不碰撞的变更,以及人类进行审查和决策的碰撞)。所有内容都配有两个展示,比较两个大脑及其尺度。</p><h2>起因:企业知识管理</h2><p>回顾六十年的知识管理历史,我们会发现这并非全新事物,但我们的工作方式——从基础到维基,再到图表,现在是大语言模型增强——都很有趣:</p><p>作为个人知识型,我用图表连接个人生活、学校甚至工作的笔记。最初是用Roam,但你也可以用任何关联的笔记应用,比如Obsidian或Logseq。<br><br>我建议使用像这样的开放文件格式<strong>Markd…</strong></p>
评论点赞收藏15 天前

我们是否正在为 AI 重新发明数据工程的工具?

作者 Simon Späti 基于 15 年数据编排工具(Airflow、Dagster、Prefect、Kestra)经验,认为当前涌现的 AI 编排工具本质上是数据工程编排的翻版:调度、错误日志、可重启性等需求相同,只是把数据集换成了 embeddings。 他此前在向量数据库章节就主张将向量能力融入既有数据工程生命周期,而非另起平行栈,并出版了一本关于数据工程模式与重复演进的书。 文章短,属于个人观察与观点,对 AI 基建是否应复用现有数据工程体系有一定讨论入口,但信息量有限、缺少对特定编排工具对比或一手踩坑。
评论点赞收藏16 天前

数据语法:从定义到执行

这是“数据语法”系列 Part 2。作者展示如何用 xorq 把数据项目写成一套“语法”:名词是数据源(RSS、Bluesky firehose、GitHub、PyPI),动词是 xorq 表达式(filter/mutate/group_by/agg/order_by), 模板把句子绑定到具体仓库(dbt-core、polars 等),修饰符切换引擎(DataFusion、DuckDB、Snowflake), 最终生成内容寻址、git 版本化的 catalog 条目。 整个项目用 dlt 做摄取,再用 Ibis 作为表达式层,实现“一次建模、随处执行”的横向数据架构。 作者跑了一个 90 天窗口 DE 生态 digest,产出了一些可读结论:增速最快的都是查询/数据框引擎(ibis +49%、sqlglot +45%、DuckDB +42%、Polars +36%);sqlmesh 在 Fivetran/dbt 并购后仍 +28.6%,而 dbt-core 仅 +9.9%;DuckDB 在 Bluesky 上社交热度是第二名 5 倍;Pydantic 以 56 亿次下载居总量第一。 RSS 博客信号被作者标注为“最吵但滞后”,因此需要用四源交叉验证。文章附带完整 GitHub 仓库(de-ecosystem-digest)和 Makefile,强调模型与执行解耦:换引擎只改 stack.yaml。
评论点赞收藏16 天前

上下文层与语义层:智能体时代的入门指南

Agent时代涌现了context layer新概念,与BI工具内嵌的semantic layer形成互补:前者处理非结构化业务文档和人工规则,后者专注指标逻辑编译为SQL。 文章提出一个悖论——正因为有了agent,才需要大量上下文;而只有agent出现,才能处理这些上下文。关键挑战在于持续集成方式。
评论点赞收藏18 天前

如果你一直享受写作,说明你没有逼自己足够狠——Benn Stancil写作方法论

<p>我有幸与他讨论并分析了他们的工作流程这位传奇作家和讲故事者活跃于数据领域及更广泛领域,始于2013年(中间经历了七八年的创业中断)。<br><br>这是该系列的第一篇采访«“我很高兴能从本开始。”</p><p>由于这个系列内容主要讲述作家如何写作、如何构思故事、如何做笔记(或不做笔记)以及每个人的工作流程,我向本恩请教了他写作的起源,以及这一切是如何从他每周的周五开始的。<br><br>他如何利用截止日期逼自己超越完美,如何处理想法,以及如何通过演讲中学到的类比掌握讲故事的艺术,转化为他的写作风格和声音。<br><br>我们谈到他如何使用Sublime Text和Google Docs,最后分享了今天该如何开始的方法。</p><p>这一集充满了提升写作技巧的见解。希望你能像我和本恩交谈时那样喜欢它。</p><blockquote>[!摘要]本·斯坦西尔是谁:简介<br> 主要被认为是(一种现代商业智能工具),他在那里创办了公司博客,并成为数据领域最多产的作家之一。他于2013年共同创立了Mode,并一直工作到2024年,之后Mode于2023年被ThoughtSpot收购。从那时起,他每周都在.</blockquote><h2>本恩如何进入写作领域</h2><p>从Benn开始写作的起点说起,他告诉我这一切是偶然开始的,就像往常一样。2013年他创办了一家名为Mode的公司,当时有三家公司,他没有作为CEO创建或领导公司,所以他开始写公司博客文章。<br><br>他提到那是“内容…</p>
评论点赞收藏19 天前

写作确实是一场情绪过山车

一位技术写作者分享11年公开写作的心路历程,描述创作过程中的情绪起伏和冒充者综合征。写作不是坐下来就能干5小时的事,而是观察、愤怒、找hack、讲故事的全过程。 每天写完第二天会怀疑"这什么垃圾",需要反复修改才能看到曙光。作者还提到正在做一档叫Show Your Workflow的节目。
评论点赞收藏33 天前

用AI生成的想法,很难真正完成

用AI生成笔记会稀释你自己的思考。作者有25979个文件的Obsidian库,反对把AI摘要混入个人知识库——因为最终你分不清哪些是自己想的,哪些是AI生成的平均内容。 建议把AI用于检索和关联发现,而不是替代你建立笔记之间的联系。Karpathy的LLM Knowledge项目是个反面例子。
评论点赞收藏35 天前

我的终端工作流:笔记、数据工程与写作(Linux/macOS)

数据工程师兼写作者分享其终端工作流:Linux用Omarchy、macOS用Yabai+skhd做平铺窗口管理;用Neovim+Obsidian写作用Vim motions;数据库查询用vim-dadbod;笔记用Zettelkasten+PKM工作流。 作者最终选择单屏+虚拟桌面方案,用Super键快速切换不同用途桌面。
评论点赞收藏49 天前

Figma for Agents:Airflow 创始人谈如何用可视化画布协调 AI 智能体

Airflow 和 Superset 创始人 Maxime Beauchemin 用自研工具 Agor 协调 AI agent,把 CEO 日常工作自动化。Agor 支持多用户协作画布、RBAC、持久化 agent 记忆,通过可视化界面管理 agent 任务和 artifacts。 他强调语义层回归和 agent 安全(Okta for Agents),并认为 Amdahl 定律在 agentic 团队工作中仍然适用。
评论点赞收藏55 天前

迷你退休:人生阶段之间的短暂休整

在学业、换工作或人生阶段转换时,用1-3个月的"迷你退休"代替长假,通过散步、接触自然等方式彻底断开工作。DHH的37Signals每几年给员工额外休假,设计师Stefan Sagmeister称自己最好的想法来自一年休假。 Steve Jobs的"连点成线"理论被引用为支持这一做法的核心论据。
评论点赞收藏57 天前

对算法和Spotify都厌倦了:自建本地音乐库并导出播放列表

作者买了Ugreen Server自建本地音乐库,用Strawberry Music Player播放MP3,通过Exportify导出Spotify播放列表和喜欢歌曲,附带Jupyter Notebook分析音乐品味。 文章提到Mary Spender离开Spotify的视频,认为未来会有更多人转向购买并拥有音乐文件,而非依赖算法推荐。
评论点赞收藏58 天前

我的公开第二大脑——660条笔记,15年,开源

<p>我是作者。~660张笔记,来自私人黑曜石 8,360字的宝库(300万字)。大约在2011年开始用OneNote, 2021年搬到Obsidian[1],导入了所有内容 Python 脚本 [2]。</p><p>笔记会随着时间累积,这就是我的写作来源 来自。语义层笔记始于2022年,后来成为 四部分的博客系列,然后是我书中的一章。具象化 视图、一大表、数据库分析和OLAP都是独立的笔记 相隔多年。后来我才注意到它们的图案是一样的, 这又成了另一个篇章。</p><p>发布:在备注中添加 #publish,运行“make deploy”。 Quartz + Hugo,rsync 到我自己的服务器[3]。代码[4]。 对图进行语义搜索[5]。</p><p>[1] [2] [3] [4] [5]</p>
评论点赞收藏58 天前

书籍推荐与读书笔记

数据工程师整理2022至2026年阅读书单,涵盖Stewart Brand《万物维护》、Cal Newport《慢生产力》、Isaacson《马斯克传》等,每本附简短个人评价。
评论点赞收藏62 天前

GoatCounter:开源隐私友好型网页分析工具的技术实现与访问计数逻辑

GoatCounter 是一个开源的网页分析平台,以捐赠支持或自托管方式提供,主打隐私保护,替代 Google Analytics、Matomo 等工具。它统计“访问次数”而非“页面浏览量”,同一会话内多次加载只计一次访问,避免刷新干扰数据。 技术细节上,它通过 siteID + User-Agent + IP 生成 session_key,内存中维护 8 小时会话映射,用 UUIDv4 标识用户路径,IP 和 UA 不持久化存储,无法反向追踪。 伪代码清晰展示访问判断逻辑:新会话或新路径才触发计数器递增。适合关注隐私、希望透明统计逻辑的开发者和小型站点运营者。
评论点赞收藏64 天前

如何基于第二大脑和 Bluesky 动态自动化生成 Newsletter

作者分享了一套基于 Python 脚本的个人 Newsletter 自动化采集方案。该方案从 Second Brain 笔记库、阅读记录和 Bluesky 动态中自动抓取更新,生成 Markdown 草稿供人工编辑,最终通过 Listmonk 发送。 设计强调“无 AI 介入”以保持个人声音,并利用 Git 日志行数过滤微小修改,通过 DuckDB 查询 Bluesky 接口获取热门帖子。
评论点赞收藏70 天前

创作的行为与结果

<p>创造,是追寻自我的终极方式;在与世界共享时,我们赋予世界以温暖与力量,并运用潜意识的力量。它带给我们喜悦与爱,对每一位艺术家而言,这正是至高无上的“流动”之境——一种幸福的境界。 创造之行 创造的过程,是一种宣泄的方式。当我们从无到有创造出某物时,这种过程会带给我们无尽的喜悦。像孩子般心怀好奇,尽情探索自己的思绪,任由其自由流淌——正如毕加索所言:“如果他事先知道画作的最终结果,便绝不会费心去开始创作。” 像一场戏剧般创造——完美而自由。如流水般平静,随心所欲地流淌,抵达你心中最向往的彼方。用创造来实现自我,让那些永不停歇的思绪得以圆满。将这份创造与世界分享。怀着喜悦与爱之心去创造。跟随自己的思维轨迹,去探寻它将引领你走向何方。你或许从某个未竟的情感、一项任务,或是任何值得深思的事物出发。而创造,尤其是写作,往往能帮助我们完成尚未解决的问题,并将其化解。 创造,尤其是书写,能够助力我们成就改变:以喜悦与欢笑为动力。创造,也意味着去创造改变。倘若人们的生活毫无变化,你的创作并未增添任何价值——然而,这些作品本可以、也应当带来改变。但首先,也是最重要的是,为自己创造改变。若创作的过程对你毫无触动,未能唤起任何情感,那么也许,这创造还远未臻于完美。请怀着爱与同理心去创造。喜欢一个人是一回事,而将爱意倾注于他人,悉心关怀他们,并将这份情感融入你的创作之中,才是创造的最高境界。用喜悦与欢笑去…</p>
评论点赞收藏77 天前

数据语法学:定义一次,跨引擎随处运行

介绍 xorq 如何通过 Ibis 表达式实现数据工程的“定义一次,到处运行”。它利用 Git 管理状态,支持在 DuckDB、Postgres 等不同引擎间无缝切换数据流,并生成可复现的 YAML 清单。 适合关注数据栈解耦、跨引擎执行效率及 AI Agent 数据上下文化处理的工程师。
评论点赞收藏84 天前

AI Agent在数据工程中的定位:构建正确性层

提出数据工程中AI Agent的三层架构,强调用确定性核心(如Rust引擎)处理SQL验证,而非完全依赖LLM。结合Altimate Code案例,演示了自动化的爆炸半径分析,解决数据变更时的下游影响评估问题。 适合关注数据管道可靠性与AI工程落地的工程师。
评论点赞收藏84 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。