微软披露一种利用Unicode标签字符的钓鱼攻击,攻击者将隐形字符插入“funding”等金融词汇,绕过垃圾邮件过滤和AI分类器,单日检测量超230万。该技术类似“ASCII走私”,可改变文本处理结果,影响NLP和LLM系统。建议在文本进入模型前移除标签字符,但需注意保留合法用途(如旗帜表情符号),并测试实际使用的分词器。
T5论文的核心贡献在于统一文本输入输出框架,并通过系统消融实验揭示了关键细节:span corruption的破坏率与平均跨度、任务前缀易被模型当作格式捷径、Encoder-Decoder结构在推理时的缓存复杂性,以及C4语料清洗规则隐含的归纳偏置。Text-to-Text框架在分类和检索任务上的适用性仍存争议,生成式检索在百万级语料上的扩展性问题尚未解决。
复旦大学NLP团队推出“切问学术”智能体,类似学术版Codex,可自动复现论文、申请GPU、跑实验、写综述。它支持零算力部署、自主修复环境、灵感发现、长任务综述生成,并具备语义搜索、知识库对话等功能。旨在接管重复劳动,让科研人员专注创新。
月之暗面四位创始人分别在NLP、CV、知识图谱和工程化领域深耕,技术互补覆盖AI全链路。他们长期积累的信任网络和跨领域经验构成公司核心护城河,比算法更持久。
月之暗面四位创始人分别深耕NLP、CV、知识图谱和工程化,技术互补覆盖AI全链路。他们背景各异,但长期信任网络形成高效协作,成为公司核心护城河。算法可复制,信任难超越,这种组合比同质化团队更具价值。
切问学术推出的AI工具“龙虾”OpenClaw,能够自动复现论文,简化科研流程。用户只需上传PDF,AI会评估实验复杂度、自动部署环境、修复Bug,并提供研究改进建议,使科研人员更专注于创新。
切问学术是复旦大学NLP实验室开发的智能科研工具,旨在提升文献搜索和阅读效率。它利用自然语言处理技术,精准匹配研究意图,并提供文献管理和翻译功能,帮助科研人员高效获取信息。
本文介绍了如何在华为开发者空间利用云主机构建DeepSeek智能文档处理器,进行社交媒体情感分析。通过NLP技术和模型接入,用户可在Cherry Studio中实现文档续写、优化和摘要提取,从而提高文本处理效率。
大型推理模型(LRMs)在长链推理能力上面临挑战,现有评测体系无法有效评估其复杂任务表现。复旦大学与美团推出的R-HORIZON框架通过问题组合方法提升了模型的多步推理能力。评测显示,主流模型在长链推理中性能普遍下降,存在推理长度、反思机制和预算分配等瓶颈。通过强化学习训练,R-HORIZON显著提升了模型推理性能,标志着研究范式的转变。
自然语言处理(NLP)使计算机理解和生成类人语言。本文介绍了从零开始创建NLP项目的步骤,包括环境配置、工具选择和常见任务(如情感分析和文本分类)。开发者需具备Python编程和机器学习基础。NLP系统通过分析语法、语义和上下文处理语言,广泛应用于聊天机器人和翻译软件等领域。
广泛使用的npm包expr-eval发现严重安全漏洞(CVE-2025-12735),可能导致远程代码执行。攻击者可通过恶意输入执行系统命令,影响AI和NLP应用。开发者应立即升级至expr-eval-fork 3.0.0版本以修复该漏洞。
本月社区更新了200多个开源大模型和30多个实训项目,涵盖多模态和NLP等领域,并新增300多个数据集,支持AI在真实业务中的应用。同时,文心开源创新大赛和Hackathon活动成功举办,促进了开发者之间的交流与合作。
本文介绍了如何通过Langfuse提升大模型(LLM)和多智能体(Agents)的可观测性。Langfuse是一个开源平台,提供追踪功能,帮助开发者监控LLM的调用路径、响应时间和成本等关键指标。文章展示了Langfuse与OpenAI和Anthropic的集成案例,以及单智能体和多智能体的应用场景,从而优化LLM应用的稳定性和性能。
本文介绍了PdfTocExtractor工具,该工具专注于从PDF中提取目录,支持多种输出格式,并具备基于NLP的语义分析功能,能够识别无书签PDF的章节标题。用户可以高效生成结构化目录,节省时间并提高准确性。未来计划包括AI目录识别和Web API等功能。
本文介绍了PdfTocExtractor,一个C#工具,用于从PDF中提取目录。该工具支持多种输出格式,并新增基于NLP的语义分析功能,能够识别无书签的章节标题,旨在提高PDF目录提取的效率。
GraphNet项目邀请开发者共建涵盖NLP和CV任务的百万张计算图数据集,以支持AI编译器的训练与验证。活动截止至8月19日,成功贡献者将获得奖励,并评选优秀共创者。线上讲解会定于8月7日举行。
happy-llm 是一个中文教程项目,介绍大语言模型的原理与实践,涵盖 Transformer 架构、预训练模型及 LLaMA2 的搭建与训练,适合有编程基础的 NLP 爱好者。
机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。
机器之心数据服务现已上线,提供高效稳定的数据获取服务,简化用户的数据爬取流程。
本文探讨了注意力机制在时间序列分类中的应用,强调其动态聚焦能力。通过计算重要性分数并加权生成上下文向量,注意力机制在处理变长异常和可解释性方面优于传统模型。文章建议以时间序列为起点,逐步深入NLP任务,以提升语义理解能力。
完成下面两步后,将自动完成登录并继续当前操作。