标签:model-fine-tuning
-
人工智能智能体驱动的业务入口与开源模型演进
📝
🎙️ a16z
📄 文章探讨了人工智能智能体作为业务首要入口的角色,以及在企业应用中从前沿闭源模型向微调后的开源模型的迁移路径。核心观点包括:早期使用前沿模型以快速交付价值;随着规模扩大和对延迟的考量,转向需要精细控制的小型、可微调的模型(如开源模型);最终强调了“产品化思维”和“玻璃盒模式”,即为客户提供高度自主、透明且易于迭代的核心架构,而非不透明的黑盒服务。 -
主权逃逸速度:基于开源模型的所有权 —— Google DeepMind 深入解析 Gemma 4
📝
🎙️ AI Engineer
📄 在这场演讲中,Google DeepMind 团队介绍了全新开源模型 Gemma 4 家族,并深入探讨了企业与主权机构对“模型所有权”的刚需。演讲阐述了 Gemma 4(包括移动端的 E2B/E4B 和高效的 26B/31B 模型)如何在保障数据隐私、支持离线处理以及降低 Agentic 任务 token 成本方面赋能开发者,强调了本地部署对于系统主权与算力成本控制的战略级意义。 -
停止盲目扩大模型:用强化学习与优质数据让4B模型超越235B模型
📝
🎙️ AI Engineer
📄 Snorkel 开发者倡导者 Kobe Crawford 分享了一项研究成果:在金融分析的工具使用任务中,通过基于高质量领域数据的强化学习(RL),一个 40 亿参数的小模型成功超越了 2350 亿参数的大模型。文章强调了工具使用纪律对模型性能的决定性作用,并展示了低成本(不到500美元)微调的巨大潜力。 -
Google DeepMind 的开源 AI 战略与 Gemma 模型解析
📝
🎙️ Latent Space
📄 本访谈由 Omar Sanseviero 深入解析了 Google DeepMind 的开源模型 Gemma 4 系列,重点介绍了其在高效参数利用、端侧部署能力、多模态性能以及研发背后的工程协作与开源社区生态,并探讨了文本扩散模型的前景及模型微调趋势。 -
AI编程的危险幻觉:能力提升与知识侵蚀
📝
🎙️ Machine Learning Street Talk
📄 本次访谈探讨了AI辅助编程的深层影响。嘉宾 **Jeremy Howard** 认为,过度依赖AI可能导致开发者对底层技术理解的退化,形成“控制幻觉”,甚至侵蚀组织内部知识。对话深入讨论了AI在代码生成、模型微调、创造力边界等方面的能力,并对AI在软件工程领域带来的风险与机遇进行了批判性分析。