分类:testing
共 5 篇文章
-
形式化方法与验证在软件工程中的应用及未来趋势
📝
🎙️ The Pragmatic Engineer
📄 文章探讨了形式化方法的概念,从将隐式知识显式化的过程入手。重点讨论了该领域如何应用于分布式系统(如AWS的案例),以及基于属性的测试作为折中方案的价值。同时分析了人工智能对形式化验证的主流影响,并总结了在并发问题处理上实践经验的重要性。 -
SpaceX星舰纪录片:冲破物理极限的V3代星舰与猛禽3发动机开发纪实
📝
🎙️ Money or Life 美股频道
📄 本片深度记录了SpaceX研发第三代(V3)星舰及其超重型助推器的曲折历程。从Booster 18的氮气增压爆炸,到Booster 19的10台及33台猛禽发动机静态点火中止(Pad Abort),再到Massey测试场的重建,展现了SpaceX通过快速迭代、极限简化设计(猛禽3代)以及在失败中搜集数据的独特工程哲学。 -
社交平台启动秘密项目,利用虚假未成年人账号进行竞争对手的AI安全投毒
📝
🎙️ Best Partners TV
📄 文章揭露了某大型科技公司为突破竞争对手AI模型的安全防线而进行的秘密操作“戛纳计划”。该项目涉及雇佣外包人员伪装成未成年用户,批量向主流聊天机器人发送包含自残、性暴力等极端诱导内容的测试数据。Meta对此采取强硬辩护态度,将此行为定性为负责任的安全基准测试,引发了行业对安全边界商业化转移的深刻反思。 -
人工智能工程师世界博览会总结与展望
📝
🎙️ AI Engineer
📄 本文记录了“AI工程师世界博览会”的第四天活动回顾,重点介绍了测试框架工程的主题演讲、前沿模型能力探索以及代码责任与问责制等核心议题。文章强调了在构建软件工厂和迭代学习中的重要性,并探讨了在智能体时代下如何重新定义人类对代码交付的责任归属问题。 -
SWE-Bench Pro 饱和之后,有人做了一把新尺子
🎙️ yage.ai
📄 DeepSWE 是针对现有编程基准测试(如 SWE-Bench Pro)数据污染与验证僵化设计的全新测量工具。它通过全新任务集与灵活验证方法,显著拉开了各顶配模型在编码能力上的表现差距,揭示了旧测量工具评估大模型能力时的局限性。