标签:on-device-ai
-
模型进了设备,治理留在云端:端侧 AI 的控制面现状
🎙️ yage.ai
📄 文章深入分析了端侧AI模型在实际应用中,其计算(数据面)与治理控制(控制面)的架构现状。核心观点是,尽管模型权重可部署在本地设备上以降低延迟,但关键的审核、签名、水印注入等控制面机制仍需依赖云端服务器进行处理和管理,这体现了端侧AI与云端治理之间的分工界限。文章对比了微软、OpenAI、Google等主流厂商在端侧AI架构上的同构逻辑,强调了控制面治理的必要性,以及法律法规如何将合规责任置于服务提供商而非终端用户身上。 -
谁是上半年最佳AI?2026年中颁奖特辑!
📝
🎙️ 人民公园说AI
📄 本期节目回顾了2026年上半年大模型行业的走势,嘉宾们评选出各自心目中的最佳AI,深入探讨了中国模型作为“平替”在生态中的定位、智能普惠的发展路径、Token出海的新商业模式,以及传统科技巨头跨越周期的生存智慧。 -
端侧智能与SAGE模型挑选框架:如何用本地小模型抹平与云端大模型的性能差距
📝
🎙️ AI Engineer
📄 本文基于 Rachel Lee Neighbors 在 Arize 的演讲,深入探讨了以本地小语言模型(SLM)替代云端大模型的策略。作者分析了云端推理在安全、延迟和成本上的痛点,提出了由 Google 联合制定的“大处原型,小处部署(Prototype Big, Deploy Small)”与 SAGE 模型挑选框架,并详述了如何通过少样本提示和后处理技术使 Llama 3.2 3B 达到并超越 Claude 的业务效果,每日节省 1 美元推理费用。 -
你的 Android 手机里藏着一个通知总控台
🎙️ yage.ai
📄 文章探讨了Android系统中的NotificationListenerService (NLS) 机制,它允许应用在每条通知发出时进行内容级别的决策和干预。通过结合端侧AI模型(如Qwen3-1.7B),可以将通知过滤从简单的来源开关升级到基于语义的内容理解,从而实现更精细的通知管理,例如逐条判断是否是剧透或根据紧急程度动态调整优先级。 -
Google DeepMind 的开源 AI 战略与 Gemma 模型解析
📝
🎙️ Latent Space
📄 本访谈由 Omar Sanseviero 深入解析了 Google DeepMind 的开源模型 Gemma 4 系列,重点介绍了其在高效参数利用、端侧部署能力、多模态性能以及研发背后的工程协作与开源社区生态,并探讨了文本扩散模型的前景及模型微调趋势。 -
语音 AI 的 “Her” 时刻:从级联架构到全双工本地化的路径演进
📝
🎙️ AI Engineer
📄 Gradium AI 创始人 Neil Zeghidour 深入探讨了语音 AI 实现电影《她》中自然交互的核心障碍。文章分析了级联系统的延迟瓶颈、全双工交互(Full-Duplex)在社交反馈中的重要性,以及副语言理解(Paralinguistics)的缺失。最后,他提出了通过本地 CPU 运行的轻量级模型来解决成本与隐私问题,助力语音应用走向规模化。 -
Gemma 4 技术全解:Google DeepMind 如何重塑高效模型与原生多模态架构
📝
🎙️ AI Engineer
📄 Google DeepMind 研究员 Cassidy Hardin 深度解析了最新发布的 Gemma 4 系列模型。本文涵盖了 2B/4B 端侧模型、26B MoE 以及 31B 稠密模型的架构创新,重点探讨了局部与全局注意力交替机制、层级嵌入(PLE)存储优化,以及支持可变分辨率的原生多模态处理逻辑。 -
AI工程迈阿密大会第二天:智能体、模型优化与开发者体验
📝
🎙️ AI Engineer
📄 本次AI工程迈阿密大会第二天汇集了多位专家,探讨了AI领域的最新进展和挑战。演讲涵盖了智能体编程的成功实践与心理障碍、大语言模型推理的延迟优化、移动设备上的扩散模型部署、专业化模型与子智能体的应用、知识图谱在上下文工程中的作用、智能体记忆系统的新范式、以及IDE和CLI在AI时代的角色转变。与会者深入了解了如何构建更高效、可靠且可解释的AI系统,并强调了开发者在AI发展中的核心价值。 -
语音AI的未来:实时语音克隆、端侧部署与即时翻译的革新
📝
🎙️ The MAD Podcast with Matt Turck
📄 Gradium公司(源自QI实验室)展示了其在实时语音AI领域的突破性进展,包括PocketTTS端侧模型、Radbot语音代理框架及Hibiki实时翻译系统。这些技术实现了高质量语音克隆、低延迟互动和跨语言沟通,预示着游戏、直播、无障碍通信等领域的全新可能性。