跳到正文
IT之家·· 3 小时前AI 评分65

Liquid AI 开源 d1 系列两款决策模型,单次判断最快 8 毫秒

Liquid AI 开源 d1 系列决策模型:单次判断仅 8 毫秒,支持图像输入

AI 导读

Liquid AI 于 10 月 7 日推出 d1 系列两款开放权重决策模型,分别是支持文本与图像输入的 d1-3B,以及支持文本、图像及语音输入的 d1-omni-600M。两款模型已在 Hugging Face 公开,可供下载、微调和部署;d1-3B 在 Decision Index v0.2.1 公开测试集获得 48.57 分,并在 NVIDIA RTX 4090 上单次回答耗时 8 毫秒。

正文

IT之家 10 月 9 日消息,Liquid AI 于 10 月 7 日发布博文,宣布推出 d1 系列两款开放权重决策模型:d1-3B 支持 31.2 亿参数的文本与图像判断,d1-omni-600M 以 5.87 亿参数支持文本、图像及语音输入。

IT之家援引博文介绍,在 Jev 模型 9 月推出爆火后,OpenAI 等公司也相继推出类似的决策模型,而 Liquid AI 是加入该战局的新成员,本次推出的 d1-3B 与 d1-omni-600M 已在 Hugging Face 公开,用户可下载、微调并部署。

d1-3B 拥有 31.2 亿参数,基于视觉语言模型 LFM2.5-VL-3B 训练,支持文本与图像输入。该模型在 Decision Index v0.2.1 公开测试集获得 48.57 分,Liquid AI 称其领先所有 10B 以下模型。

d1-omni-600M 拥有 5.87 亿参数,基于双向编码器 LFM2.5-Encoder-350M 训练。该模型支持文本与图像,或文本与语音的组合输入,属于 Liquid AI 首个实验性多模态决策模型检查点。

在推理速度方面,d1-3B 在 NVIDIA RTX 4090 上回答单个问题耗时 8 毫秒,处理 384 像素图像耗时 102 毫秒。在 Jetson AGX Thor 上,单问耗时 16 毫秒;在 Jetson Orin Nano 上为 50 毫秒。

用户测试显示,d1-3B 在 12GB 显存的 GeForce RTX 3060 上,单次判断耗时 25 毫秒,处理 640×480 像素图像耗时 146 毫秒,峰值显存占用约 6GB。另有用户报告,该模型在 RTX 3090 上单次判断耗时 8 毫秒。

来源:IT之家 · ithome.com