本文介绍了如何在浏览器中使用Transformers.js构建多模态AI功能,包括图像分类、图像描述和语音转录。用户无需服务器或API密钥,所有数据在本地处理。教程分为三个部分:使用ViT模型进行图像分类,使用GPT-2解码器进行图像描述,以及使用OpenAI的Whisper架构进行语音转录。最终将三者整合为一个多模态媒体分析器,支持并行加载模型并在统一仪表板上展示结果。
本文介绍了如何使用Transformers.js和句子嵌入构建客户端语义搜索引擎,包括句子嵌入的工作原理、余弦相似度的计算、嵌入的生成与缓存,以及可重用的SemanticSearch类的创建。通过比较句子的语义而非关键词,语义搜索提高了搜索结果的相关性。
Transformers.js 是一个在浏览器中运行的自然语言处理库,无需服务器,支持文本分类、零-shot 分类和问答等任务。模型首次下载后可离线使用,功能与 Hugging Face 的 Python 版本相同,使用 ONNX Runtime 执行模型,用户可通过简单的 JavaScript 调用进行推理,适合多种应用场景。
2026年第二季度,通过浏览器的WebGPU进行AI推理并不值得。尽管transformers.js升级后支持q8模型,但性能仍然不佳,且硬件支持有限。大多数设备不支持WebGPU,WASM推理速度慢,导致AI多在云端运行。国产AI芯片前景不乐观,CUDA生态复杂,推理过程中的矩阵运算面临许多挑战。
背景去除是图像处理中的常见任务,传统方法通常依赖复杂软件或云服务。本文介绍如何利用React和Transformers.js在浏览器中构建强大的背景去除工具,支持多种AI模型,具备批处理和内置图像编辑功能,确保用户隐私。
本文介绍了一个开源绘图板,利用Transformers.js实现背景去除和图像分割。采用Xenova/modnet模型进行背景去除,使用Xenova/slimsam-77-uniform模型进行图像分割,并支持WebGPU以提升处理速度。
Transformers.js库让开发者可以在浏览器中直接运行深度学习模型,无需服务器。结合React,支持自然语言处理、计算机视觉等任务,易于与Next.js集成。通过WebAssembly优化性能,支持多语言翻译和语音合成,提升网页应用的智能性和隐私保护。
该文章介绍了如何使用PGlite在IndexedDB中构建本地语义搜索体验。通过存储文本和嵌入,并使用pgvector进行内积搜索,可以快速展示相关产品或类似产品给用户。
Transformers.js是一个在浏览器中运行的Web机器学习库,支持多种任务,包括语音识别、自然语言处理、计算机视觉、音频和多模态。它使用ONNX Runtime在浏览器中运行模型,并支持将PyTorch、TensorFlow或JAX模型转换为ONNX。演示示例中的Whisper tiny模型可以在CPU上以实时速度运行。
开源日报第1082期推荐了开源项目《transformers.js》,该项目使用ONNX Runtime在浏览器中运行模型。英文原文《Top Three Causes of Memory Leaks in JavaScript》介绍了JavaScript中内存泄漏的三个主要原因:未清除的定时器和计时器、悬挂的事件监听器以及闭包。文章还提到了Chrome DevTools Memory Profiler作为开发者的有用工具。
本文介绍了使用Transformers.js制作基于机器学习的网页游戏的方法。作者展示了如何制作一个实时的ML-powered网页游戏Doodle Dash,该游戏完全在浏览器中运行。教程目标是向读者展示制作自己的ML-powered网页游戏的简单性。游戏中,玩家需要在一分钟内画出尽可能多的物品,每次给出一个提示词。如果模型预测正确,画布将被清除并给出一个新的词。教程分为三个部分:训练神经网络、使用Transformers.js在浏览器中运行模型和游戏设计。
完成下面两步后,将自动完成登录并继续当前操作。