1. Baseten 用 Claude Code 自动生成推理引擎,解码速度超 vLLM 九成
Baseten工程师借助MetaInfer技能工具包,让Claude Code为Qwen-3.6-35B-A3B模型自动构建推理引擎。在单张B200上以NVFP4精度运行,该引擎单流解码速度比vLLM 0.25.1最高快90%,首token延迟从28毫秒降至12毫秒,并发32时吞吐量高出71%。
来源:Baseten 工程博客
今日 AI 领域值得注意的动态,共 3 条。
Baseten工程师借助MetaInfer技能工具包,让Claude Code为Qwen-3.6-35B-A3B模型自动构建推理引擎。在单张B200上以NVFP4精度运行,该引擎单流解码速度比vLLM 0.25.1最高快90%,首token延迟从28毫秒降至12毫秒,并发32时吞吐量高出71%。
苹果宣布将在Mac上对“全盘访问”权限施加新限制,以应对AI代理带来的风险。该公司在周五的更新中表示,将推出新控制措施,确保只有真正希望授予应用这种高级别访问权限的用户才能进行操作。此前TechCrunch报道了这一消息。
Meta 在 Product Hunt 发布一套开源工具包,面向希望自行搭建 AI 硬件的开发者。该套件提供构建智能设备所需的软硬件参考方案,开发者可基于它设计并组装属于自己的 AI 小工具,具体组件清单与获取方式见项目页面。