
从SAM3到YOLOcoreai-models端侧视觉模型导出与图像分割完整指南【免费下载链接】coreai-modelsModel export recipes, Python primitives, and Swift runtime utilities for on-device AI项目地址: https://gitcode.com/gh_mirrors/co/coreai-modelscoreai-models是 Apple 开源的端侧 AI 模型工具集提供一套模型导出配方export recipes、Python 原语和 Swift 运行时工具让你把 SAM3、YOLO 等热门开源视觉模型一键导出为 Core AI 的.aimodel格式直接在 iOS 和 macOS 设备上完成图像分割、目标检测等推理无需联网、无需 GPU 服务器。一、coreai-models 是什么端侧视觉模型导出全家桶项目围绕导出 → 运行两条主线组织四大目录各司其职目录作用models/模型目录每个模型一张模型卡README 导出脚本export.pypython/src/coreai_models/Python 原语用 PyTorch 编写自定义 Core AI 模型的可复用积木swift/Sources/Swift 运行时包在 App 中加载并运行导出的.aimodelskills/给编程 Agent 用的技能插件让 AI 助手像专家一样操作 Core AI运行环境要求详见根目录 README.md导出模型安装 uvbrew install uv运行模型macOS / iOS 27.0Xcode 27.0导出产物为独立的.aimodel文件语言模型、扩散模型等会额外生成含 tokenizers 的资源目录二、快速开始3 步搭好模型导出环境第 1 步克隆仓库git clone https://gitcode.com/gh_mirrors/co/coreai-models cd coreai-models第 2 步确认 uv 已安装brew install uv第 3 步列出所有支持的模型uv run coreai.model.registry --list-models模型目录覆盖 LLM、扩散模型、VLM、视觉模型CLIP、Depth Anything、EDSR、EfficientSAM、PVT、SAM 3、YOLOS、音频与文本模型完整清单见 models/README.md。模型注册表源码在 python/src/coreai_models/model_registry.py。三、导出 SAM3文本提示驱动的图像分割模型SAM 3Segment Anything Model 3是 Meta 的统一视觉模型给它一句话如cat或视觉提示就能把图中目标分割成掩码mask。模型约 848M 参数是端侧图像分割的旗舰选择。SAM3 图像分割导出步骤Lite 版默认推荐Lite 导出专为iOS / Apple 神经引擎优化模型被重构为 BC1S 布局并拆成 3 个可独立压缩的函数——函数输入输出压缩策略image_encode图像骨干特征4-bit k-means 调色板量化 fp16text_encode文本 ID文本特征6-bit 调色板量化 fp16detect两组特征掩码 / 框 / 置信度fp16运行导出脚本位于 models/sam3/export.py说明文档见 models/sam3/README.mduv run models/sam3/export.py⚠️ SAM3 在 Hugging Face 上属于gated 模型需先接受许可、生成 token 并执行hf auth login --token YOUR_TOKEN完成认证。导出后生成exports/sam3_lite_336_w4_static/目录内含.aimodel、tokenizer/和metadata.json。常用参数--image-size 336iOS 部署推荐分辨率1008 为高质量档--full不针对 iOS导出原版 HF 模型质量更高、体积更大--dry-run只打印解析后的配置不实际导出命令行导出入口实现于 python/src/coreai_models/segmentation/export.py同时支持--full完整模型与--video视频分割三种路径。SAM3 视频分割跨帧追踪稳定目标 ID如果你要处理视频sam3_video导出会把模型拆成 7 个函数每帧一次 ViT 前向检测与追踪共享在视频逐帧检测文本提示对象并链接成带稳定 ID 的 masklets。工具链见 models/sam3_video/README.md 与 models/sam3_video/export.py。uv run models/sam3_video/export.py --image-size 336 # 降低分辨率可显著减少延迟四、YOLO 导出一条命令得到目标检测模型目录 models/yolo/ 提供的是YOLOSYou Only Look at One Sequence把 Vision Transformer 直接作用到图像 patch 上输出边界框和类别分数是 YOLO 家族的 Transformer 变体。导出只需一条命令脚本见 models/yolo/export.pyuv run models/yolo/export.py产物为exports/hustvl_yolos-base_float32_static.aimodel。两个实用参数--dtype float16半精度导出减小体积--dynamic启用动态形状batch 1–64空间尺寸 128–1024 且为 16 的倍数适合一张图或多张图混跑的场景模型参数量hustvl/yolos-tiny6.5Mhustvl/yolos-base127M五、轻量备选EfficientSAM 点提示分割不想用 848M 的 SAM3EfficientSAM只有约10M 参数基于 ViT-Tiny点击或画框即可分割非常适合算力受限的 iOS 场景models/efficient-sam/README.md。uv run models/efficient-sam/export.py # 单击前景Q1, P1 uv run models/efficient-sam/export.py --num-pts 2 # 框提示左上右下两点 uv run models/efficient-sam/export.py --num-queries 64 # 8×8 网格万物分割导出参数速查models/efficient-sam/export.pyQ--num-queries每张图独立掩码的数量P--num-pts融进同一条提示的点数框提示必须同一 query 内 P≥2⚠️--dynamic与float16不兼容运行时无法在 fp16 下处理动态 reshape动态批量请用 float32六、跑起来Swift 运行时与命令行工具图像分割ImageSegmenter运行时源码位于 swift/Sources/CoreAIImageSegmenter/ImageSegmenter.swift集成只需几行 Swiftimport ImageSegmenter let segmenter try await ImageSegmenter(resourcesAt: exports/sam3_lite_336_w4_static) let segments try await segmenter.segment(image: cgImage, prompt: cat) // SAM3 文本提示不想写 App用内置 CLI 工具swift/Sources/Tools/image-segmenter/ImageSegmentationRunnerMain.swift# SAM3 文本提示 swift run -c release image-segmenter --model exports/sam3_lite_336_w4_static --prompt cat --image cat.jpg # EfficientSAM 点提示x,y 为输入图像像素坐标 swift run -c release image-segmenter --model exports/efficient_sam_vitt_float32_static --image cat.jpg --point 100,100目标检测ObjectDetectorobject-detector工具驱动 swift/Sources/CoreAIObjectDetector/ObjectDetector.swiftswift run -c release object-detector --model exports/hustvl_yolos-base_float32_static.aimodel --image street.jpg动态形状导出可批量检测并预热内核swift run -c release object-detector --model dynamic.aimodel --image a.jpg --image b.jpg --input-height 800 --input-width 1024 --warmup视频分割VideoSegmentervideo-segmenter会输出带叠加标注的 mp4每个对象的掩码、边界框和#id 提示词 分数字幕合成到原画面上同一轨迹全程保持同色源码 swift/Sources/CoreAIVideoSegmenter/VideoSegmenter.swift。swift run video-segmenter --model exports/sam3_video_float16 --input-video clip.mp4 --prompt person --output out.mp4七、常见问题速查 ❓问题解答导出报权限错误SAM3 是 gated 模型先hf auth login认证模型体积太大用 Lite 导出336 分辨率 调色板量化或换 EfficientSAM精度要求高--full导出 1008 分辨率的 float32 模型想让 Agent 帮我操作 Core AI安装 skills/ 下的技能插件想压缩/量化模型使用coreai-opt的 YAML 配方参考 models/qwen3/qwen3_0_6b_mixed_4bit_8bit.yaml 这类自定义配方八、延伸资源视觉模型总目录models/README.mdCLIP、Depth Anything、EDSR、PVT 等Python 原语库自写模型用python/src/coreai_models/primitives/分割导出管线python/src/coreai_models/segmentation/pipeline.pySwift 运行时共享层swift/Sources/CoreAIShared/总结coreai-models 把下载开源模型 → 端侧导出 → App 内运行整条链路做成了开箱即用的配方——SAM3 负责语义图像分割YOLOS 负责目标检测EfficientSAM 负责轻量场景配合 Swift 运行时你可以在 iPhone 和 Mac 上离线跑起完整的视觉 AI 应用。【免费下载链接】coreai-modelsModel export recipes, Python primitives, and Swift runtime utilities for on-device AI项目地址: https://gitcode.com/gh_mirrors/co/coreai-models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考