小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
你手机的向量索引可能比运行它的AI模型还大

谷歌发布开源多模态嵌入模型EmbeddingGemma 2,参数7.4亿,可将文本、代码、图像、视频和音频映射到同一768维向量空间,无需预生成字幕或转录。模型基于Gemma 4,采用Apache 2.0许可,支持端侧部署,上下文窗口8192 token。借助Matryoshka技术,向量可截断至256或128维,节省存储的同时多模态检索质量仍保持约95%。

你手机的向量索引可能比运行它的AI模型还大

The New Stack The New Stack · 2026-10-06T18:53:07Z
在线教程丨2B跑赢4B,同级开源模型SOTA,OpenBMB推出MiniCPM5-2B,支持131K长上下文与工具调用

OpenBMB推出MiniCPM5-2B,采用Llama架构,面向端侧部署。官方评测平均分53.9,达2B级开源领先,部分超4B模型,覆盖代码、数学推理、长文本与工具调用,原生支持131,072 token上下文。HyperAI已上线配套教程,支持在线体验与一键部署。

在线教程丨2B跑赢4B,同级开源模型SOTA,OpenBMB推出MiniCPM5-2B,支持131K长上下文与工具调用

HyperAI超神经 HyperAI超神经 · 2026-09-23T12:05:24Z
128K长上下文+智能体强化训练!LFM2.5-2.6B解锁端侧大模型高效部署;DETR用Transformer斩断NMS与Anchor,重塑目标检测

LFM2.5-2.6B是面向端侧部署的轻量级AI推理模型,支持128K长上下文和智能体工具调用,性能可与大4倍参数模型竞争。在Apple M5 Max上推理速度达220 tok/s,AMD Ryzen CPU上113 tok/s,内存占用低于2.5GB,平衡了轻量化与高性能。HyperAI官网已上线该模型,并提供相关数据集、教程和百科词条更新。

128K长上下文+智能体强化训练!LFM2.5-2.6B解锁端侧大模型高效部署;DETR用Transformer斩断NMS与Anchor,重塑目标检测

HyperAI超神经 HyperAI超神经 · 2026-08-15T08:16:23Z

清华大学与面壁智能推出的MiniCPM-V 4.0模型,参数减少至4.1B,提升了移动端图像理解能力,并支持iOS应用,推动了端侧部署的广泛应用。

性能赶超GPT-4.1-mini!MiniCPM-V 4.0达端侧图像模型新高度;HelpSteer3让AI回应更接近人类思维

HyperAI超神经 HyperAI超神经 · 2025-08-19T07:36:29Z

PaddleX 3.0-beta1版本在AI模型部署方面进行了重要升级,提供高性能推理、服务化部署和端侧部署解决方案,以满足多样化的应用需求。高性能推理插件提升了模型推理速度,服务化部署增强了系统灵活性,端侧部署支持在用户设备上运行,确保快速响应和隐私保护。

飞桨PaddleX高性能推理、服务化部署、端侧部署能力详解与实战

百度大脑 百度大脑 · 2024-10-31T11:21:17Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码