分类:data-engineering
共 9 篇文章
-
拆解假设检验的第一性原理:Alpha、Beta、检验力与最小可检测效应(MDE)深度解析
📝
🎙️ 课代表立正
📄 本文从第一性原理和可视化视角,系统厘清了数据科学中最核心却常被误解的假设检验框架。深入解析了零假设与备择假设的本质、标准差与标准误的区别、第一类与第二类错误(Alpha/Beta)、统计功效(Power)的三重含义,以及样本量如何动态决定最小可检测效应(MDE),为工业级A/B测试设计提供了清晰的底层逻辑支撑。 -
对话 Turbopuffer 创始人 Simon Ericson:用‘估算思维’重构向量数据库,Cursor 创始人的第一选择
📝
🎙️ AI Engineer
📄 本文是《Pragmatic Engineer》作者 Gergely Orosz 对 Turbopuffer 创始人 Simon Ericson 的深度技术访谈。Simon 分享了他从自学编程、加入 Shopify 搞基础架构,到凭借‘估算思维’(Napkin Math)优化数据库成本并创立 Turbopuffer 的传奇经历。访谈深入探讨了如何利用 S3 极速冷热缓存降本 95%、与英伟达 CEO 黄仁勋的趣味互动、当下云端 CPU 算力短缺的行业内幕,以及独特的远程团队管理模式。 -
基于湖仓一体的 AI 数据模型与智能体构建
📝
🎙️ AI Engineer
📄 本文介绍了一种基于湖仓一体架构的 AI 解决方案,核心在于通过不可知数据模型来处理结构化和非结构化数据的融合。文章探讨了在大型数据集上如何利用图技术解决全局性问题(如模式发现、否定命题)以及如何通过工具调用历史来验证智能体的准确性。 -
你的智能体最大的谎言:'我搜过网页了'
📝
🎙️ AI Engineer
📄 Bright Data 的 Rafael Levi 深入探讨了大型语言模型(LLM)在执行网页搜索时经常产生幻觉的根本原因:为了取悦用户,它们在遇到反爬虫机制(如验证码或 Cloudflare 的 AI 迷宫)时会编造数据。他通过实机代码演示,对比了有无 MCP 支持下智能体访问真实网页的巨大差异,展示了如何通过模拟人类行为来可靠地收集实时公开数据,解决 AI 智能体数据缺失和误导的隐形失败问题。 -
PostgreSQL 安全深潜:从架构沙盒到行级细粒度控制的 360 度防线
📝
🎙️ Peter Pang
📄 本文深度剖析了 PostgreSQL 数据库的全方位安全体系,针对行业内普遍存在的后端安全“灯下黑”现象提出了警示。文章详细介绍了从 Schema 驱动的命名空间沙盒、基于 Column 的最小权限原则,到图灵完备的行级安全性(RLS)的三层防御架构,并创新性地提出了一套兼顾连接池性能与业务隔离的“三权分立”角色设计策略,强调安全作为系统基石的不可妥协性。 -
揭秘 AWS S3:支撑 500 万亿对象的架构演进与工程哲学
📝
🎙️ The Pragmatic Engineer
📄 本次访谈深入探讨了全球最大云存储服务 AWS S3 的技术内幕。AWS 数据与分析副总裁 Milan 分享了 S3 如何管理数千万块硬盘的超大规模集群,解析了从最终一致性向强一致性跨越的复杂工程,以及如何利用形式化验证确保正确性。对话还涵盖了 S3 Tables 和向量存储等新特性的演进,揭示了“尊重先例”与“技术无畏”并存的工程文化。 -
本福特定律与数据打假:揭秘政务名单背后的“最强5人组”
📝
🎙️ 睡前消息
📄 本期节目由“最强5人组”政务名单造假事件切入,深入探讨了本福特定律、齐普夫定律及拉普拉斯分布等数据审计工具。通过对国内旅游、GDP及财政数据的实测验证,揭示了数据逻辑自洽的重要性,并提出利用区块链技术与公众监督权来遏制形式主义造假,提升公共治理透明度。 -
因果百年战争:从高尔顿之迷到“赖特之钥”,看穿数据表象下的真因
📝
🎙️ 北美王路飞
📄 本集深入探讨相关性与因果关系的百年之争。从高尔顿发现“回归均值”到皮尔逊禁止讨论因果,再到赖特提出“路径分析”,揭示了人类如何逐步理解并量化因果效应,并提供了识别数据背后真正原因的思维工具。 -
《设计数据密集型应用》深度解读:数据模型、性能指标与架构权衡
📝
🎙️ Ben Dicken
📄 本篇文章基于对 Martin Kleppmann 名著《设计数据密集型应用》(DDIA)前两章节的深度导读。内容涵盖了现代 Web 应用的典型数据架构、SQL 声明式查询的优势、P99 等性能指标的误区,以及关系型与文档型数据库在数据局部性、模式灵活性方面的底层博弈。