小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge

该数据集包含 545,431 条训练样本,涵盖 285,516 条 COT 思维推理样本与 259,915 条 TIR 工具推理样本,覆盖代数、几何、数论、组合数学等竞赛与高校科研级数学场景,数据采用人工与自动化混合标注方式,包含唯一编号、题目文本、多轮对话、标准答案、来源、协议等标准化字段。该数据集共包含 10,193,029 条教学记录,总规模超过 100 亿个...

15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge

HyperAI超神经
HyperAI超神经 · 2026-07-31T06:41:12Z
文本/LaTeX/HTML表格一步搞定!OvisOCR2实现端到端文档智能解析;1.4 万+ 元素标注、万条语言指令!Voxel51 发布 SceneFun3D 室内场景微观交互数据集

该数据集包含 300 个元认知陷阱问题,覆盖数学、物理、生物、法律、医学、经济学、统计学、伦理学、计算机科学等 121 个领域,涵盖 8 种元认知行为类型,包括自我纠正、陷阱逃脱、转换检测、矛盾解决、渐进发现、多约束处理、专家面板和不确定性决策。GLM-5.2 Agent 是由 TeichAI 使用 Teich 生成的一个 GLM – 5.2...

文本/LaTeX/HTML表格一步搞定!OvisOCR2实现端到端文档智能解析;1.4 万+ 元素标注、万条语言指令!Voxel51 发布 SceneFun3D 室内场景微观交互数据集

HyperAI超神经
HyperAI超神经 · 2026-07-27T06:58:36Z

拆开 sqlite3_prepare_v2 内部如何把 SQL 文本经词法、语法、名字解析、查询规划变成第 5 篇执行的 bytecode;用本机 3.53.2 的 EXPLAIN QUERY PLAN 钉住三种访问路径形态,并交代 schema cookie 触发 reprepare 的机制,规划算法细节留给第 11 篇。

【SQLite 内核】SQL 编译管线:从文本到 VDBE 程序

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-07-18T00:00:00Z
Vocalinux 0.14 Beta 版发布,支持 Linux 系统上的离线语音听写/语音转文本功能

Ubuntu 26.10 正在开发情境感知桌面,首个成果是 Myna 语音转文本解决方案。同时,Vocalinux 是一款开源的 Linux 桌面语音输入工具,支持离线处理,兼容多种桌面环境。最新的 0.14 beta 版增加了快捷键支持和 API 引擎兼容性。

Vocalinux 0.14 Beta 版发布,支持 Linux 系统上的离线语音听写/语音转文本功能

实时互动网
实时互动网 · 2026-07-16T02:24:14Z
结合文本和ID嵌入的个性化增量视频搜索

本文介绍了一种个性化增量视频搜索系统,结合语义和协作信号以提升排名。该系统利用文本和ID嵌入模型,通过用户观看历史构建用户表示。实验结果表明,个性化排名在模糊查询中效果显著,尤其对观看历史较长的用户更为有效。在线实验显示,点击率和转化率均显著提高。

结合文本和ID嵌入的个性化增量视频搜索

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-16T00:00:00Z

去掉剪切板文字格式的方法有多种,包括使用文本编辑器重新粘贴或将文字粘贴到浏览器地址栏再复制。推荐使用免费软件Pure Paste,支持设置白名单,能够去除链接数据跟踪参数。

Mac技巧之在苹果电脑上让你复制带格式的文字后粘贴出来的是无格式纯文本:Pure Paste

苹果fans博客
苹果fans博客 · 2026-07-15T06:18:06Z

本文讨论了Lucene文档模型中分析器对中文分词的影响。不同分析器(如StandardAnalyzer、ICU和IK插件)会导致不同的词项集合,从而影响索引和查询结果。文章强调索引和查询使用相同分析器是确保搜索结果一致性的关键。中文分词依赖于词典和模型,Lucene本身不提供生产级中文分词,常用插件如IK和jieba可热更新词典。分析器的选择和配置对性能和召回率有重要影响。

【全文检索引擎】分析链 Analyzer:从文本到 TokenStream

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-07-15T00:00:00Z

为Hexo博客添加隐藏AI文本功能,用户首次访问时弹窗询问是否接受AI生成内容。选择“是”则显示相关文章,选择“否”则隐藏。通过cookie记录用户选择,清除cookie可更改选项。首页隐藏AI生成文章,归档页和标签页正常展示。

为hexo博客添加隐藏ai文本的功能

晴雀宫
晴雀宫 · 2026-07-09T02:26:06Z
NVIDIA 发布 Audex (Nemotron-Labs-Audex-30B-A3B):一种统一的音频-文本大语言模型

NVIDIA 发布了 Audex,这是一个统一的音频-文本大型语言模型,具备理解和生成音频及语音的能力,同时保持文本智能。Audex 采用 30 亿参数的 MoE 结构,设计简洁,避免了多模态模型的性能退化,在文本和音频任务中表现优异,尤其在语音识别领域领先。尽管存在商业许可限制和音频理解能力不足等缺点,Audex 仍在多项任务中表现出色。

NVIDIA 发布 Audex (Nemotron-Labs-Audex-30B-A3B):一种统一的音频-文本大语言模型

实时互动网
实时互动网 · 2026-07-08T02:20:40Z
如何使用JavaScript构建基于浏览器的PDF OCR文本转换器

本文介绍了如何使用JavaScript构建基于浏览器的PDF OCR文本转换器。该工具允许用户上传PDF文件,预览页面,配置OCR设置,提取文本并导出结果。OCR技术能够识别扫描图像中的文本并将其转换为可编辑的数字文本,确保用户隐私和安全。通过优化图像质量和选择合适的OCR语言,可以提高识别准确性。

如何使用JavaScript构建基于浏览器的PDF OCR文本转换器

freeCodeCamp.org
freeCodeCamp.org · 2026-07-07T16:23:22Z
LensVLM:用于文本压缩视觉表示的选择性上下文扩展

LensVLM是一种推理框架,旨在提升视觉语言模型(VLM)在压缩图像上的表现。该方法通过选择性扩展相关图像,保持高达4.3倍的有效压缩精度,超越传统的文本和视觉压缩基线。在多模态文档和代码理解任务中,随着压缩增加,准确性显著提升。

LensVLM:用于文本压缩视觉表示的选择性上下文扩展

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-07T00:00:00Z
通过先进的模态条件和交互驯服文本到声音视频生成

该研究聚焦于文本到声音视频生成(T2SV),旨在从文本生成同步音频的视频。为解决文本条件瓶颈和跨模态特征交互机制不明确的问题,提出了交叉参考重写器(CRR)框架,通过提取语义锚点和生成解耦的字幕对,消除模态干扰,缩小训练与推理之间的差距。

通过先进的模态条件和交互驯服文本到声音视频生成

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-07T00:00:00Z
如何使用HTML、CSS和JavaScript构建文本比较工具

本文介绍了如何构建一个基于浏览器的文本比较工具,用户可以输入原始文本和修改后的文本,工具会高亮显示添加或删除的内容。该项目使用HTML、CSS和JavaScript实现,确保数据在本地处理以保护用户隐私。

如何使用HTML、CSS和JavaScript构建文本比较工具

freeCodeCamp.org
freeCodeCamp.org · 2026-07-01T15:36:17Z
使用Telnyx AI推理从杂乱文本中提取结构化JSON

本文介绍了如何使用Telnyx AI推理将杂乱文本转换为结构化JSON。该应用通过Flask端点接收杂乱文本和所需字段,返回可验证的JSON对象,便于在软件中使用。示例代码简单易懂,适合实际应用场景。

使用Telnyx AI推理从杂乱文本中提取结构化JSON

mongona news
mongona news · 2026-06-26T22:03:29Z
五个开放源代码的全能AI模型:处理文本、图像、音频和视频

近年来,开放源代码的全能AI模型逐渐成熟,能够统一处理文本、图像、音频和视频。本文介绍了五个前沿模型:NVIDIA的Nemotron 3、Google的Gemma 4、Qwen3-Omni、DeepSeek的Janus-Pro和MiniCPM-o 4.5。这些模型在多模态理解、实时交互和生成能力方面表现出色,适用于客户支持、文档分析和实时语音对话等应用场景。全能模型的出现使AI在实际工作流程中更加高效和自然。

五个开放源代码的全能AI模型:处理文本、图像、音频和视频

KDnuggets
KDnuggets · 2026-06-25T14:00:07Z

谷歌为Chrome推出新功能“从屏幕中选择”,用户可以直接选择网页中的文本或图像,并自动发送给Gemini AI。这一功能提高了回答的准确性,简化了用户提问的复杂性,提升了用户体验。该功能正在逐步推送,用户需更新到Chrome v149版。

Gemini for Chrome增加新功能:可以复制文本或圈选屏幕部分让AI可以感知内容

蓝点网
蓝点网 · 2026-06-25T03:00:46Z

微软365 Copilot推出了SharePoint Copilot Apps,用户可以在Copilot画布中直接使用交互式UX组件,简化工作流程。开发者可利用JavaScript技术构建组件,无需额外平台支持。这一功能提升了工作效率,降低了成本,并支持跨Microsoft 365平台重用组件,增强企业安全性和合规性。

超越文本的微软365 Copilot – 介绍SharePoint Copilot应用

Microsoft 365 Developer Blog
Microsoft 365 Developer Blog · 2026-06-23T12:25:46Z
结合LLM嵌入和HDBSCAN的非结构化文本聚类

本文介绍了如何结合大型语言模型(LLM)嵌入和HDBSCAN算法构建文本聚类管道,以自动发现未标记文本数据中的主题。主要步骤包括生成文本嵌入、降低维度和应用聚类,最终成功识别出两个主题聚类,展示了该方法的有效性。

结合LLM嵌入和HDBSCAN的非结构化文本聚类

MachineLearningMastery.com
MachineLearningMastery.com · 2026-06-23T12:00:57Z

自然语言处理(NLP)近年来因大型语言模型(LLMs)的应用而发生显著变化,但文本预处理仍然至关重要。文章介绍了三种使用NLTK进行有效文本预处理的方法:1)使用MWETokenizer保留多词表达的完整性;2)通过词性标注实现上下文感知的词形还原;3)利用统计方法提取关键短语。这些技术有助于提高NLP模型的准确性和鲁棒性。

三种NLTK技巧用于高级文本预处理与语言分析

KDnuggets
KDnuggets · 2026-06-22T12:00:18Z
Myna发布,成为Ubuntu桌面系统的语音转文本解决方案

Canonical 正在为 Ubuntu 26.10 开发名为 Myna 的语音转文本解决方案。Myna 提供可靠的桌面语音输入功能,用户可通过快捷键自然说话,实时转换为文本。该项目支持本地语音模型处理,无需互联网连接,初期专注于语音转文本功能。

Myna发布,成为Ubuntu桌面系统的语音转文本解决方案

实时互动网
实时互动网 · 2026-06-18T02:02:57Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码