Desert Ant Labs

面向 iOS 和 macOS 的设备端 AI 模型

即插即用的 Swift 包,在 iOS 和 macOS 上通过 Core ML 运行小而专用的设备端模型,只需几行代码。

每一个已上线的 Desert Ant Labs 模型都以 Swift 包的形式提供,基于 Core ML 构建,全程 async/await,API 读起来就像 AVFoundation 的一部分。

在 Xcode 里添加这个包,然后调用模型。一切都在设备上运行,音频、图像和文本都不会离开设备。

可用模型

RedactPII 脱敏

跨 27 种语言的可逆 PII 脱敏,来自一个内置于应用中的 11.6 MB Core ML 模型。

Emo表情符号建议

从文本给出表情符号建议,用时不到 2 毫秒,小到足以在每次按键时运行。

Gist内容主题标注

从任意文本中提取内容主题,覆盖 101 种语言,来自约 74 MB 的 Core ML 模型,或约 15 MB 的纯英文构建。

Shapes形状识别

一次调用即可实现 PencilKit 形状吸附,来自一个 0.2 MB 的 Core ML 模型,无需下载。

Clear语音增强

基于 Core ML 的 DeepFilterNet 3 语音增强:在 iPhone 16 Pro 上 302 倍实时,一段 5 分钟素材 1 秒完成。

Uhm语气词检测

直接从波形出发的帧级精度语气词检测,无需转写。

Tongue语言识别

对短文本进行语言识别,覆盖 84 种语言,来自打包进应用的 2 MB 模型。

Moderator内容审核

设备端 NSFW 图片审核,来自一个 9.7 MB 的 Core ML 模型,这项检查在上传离开手机之前就完成。

Align逐词时间戳

为任意转写文本提供更贴合的逐词时间,误差减半,来自一个 0.7 MB 的 Core ML 模型。先支持 Apple Speech。

Clips片段挑选

从转写文本生成短视频和高光并排序,基于 Core ML,25 分钟视频 9 秒完成。

Ear口语语种检测

基于 Core ML,凭 30 秒音频识别 99 种语言的口语。

Title标题与描述

为任意文本给出标题和一两句话的描述,在 Apple 芯片上通过 MLX 运行。

Voz语音识别

带逐词时间戳的语音转文字,25 种语言,完全在神经网络引擎上:在 iPhone 上 10 分钟音频 2 秒完成。

即将上线

价格

每个模型免费支持最多 10 万台月活跃设备。推理次数不限。