小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
NVIDIA把供应链专家经验训练进模型,关键不是换一个更大模型

NVIDIA供应链案例表明,专用30B模型经专家决策轨迹训练后,在内部基准上超越更大通用模型。关键在于记录专家决策时的所见、理由与结果,并避免数据泄漏。企业应先设计决策记录与评测集,再考虑微调,适用于重复、可观察、有规律的任务。

NVIDIA把供应链专家经验训练进模型,关键不是换一个更大模型

Java for You Java for You · 2026-09-12T02:55:49Z

该文章总结了AI工作流中七种常见的静默错误,包括预处理拟合在数据分割前导致数据泄漏、随机分割破坏数据独立性、训练与推理预处理不一致、种子设置不完整、评估状态与梯度禁用混淆、广播掩盖张量形状错误,以及将保存模型视为惰性文件。每种错误都伴随误导性症状和检查方法,强调通过代码审查和元数据记录确保工作流可靠性。

AI工作流中应避免的7个常见Python错误

KDnuggets KDnuggets · 2026-09-01T12:00:21Z
Steam 12TB 游戏数据泄漏:横跨 10 年,大量未公开内容曝光

Steam发生大规模游戏数据泄漏,超12TB的2003至2013年Steam2数据被公开,含《传送门2》《求生之路》《CS》等未公开早期版本及被取消项目资产。数据来自公开API,无密码保护。泄漏内容不含用户密码或支付信息,非源代码泄漏,普通用户不受影响。

Steam 12TB 游戏数据泄漏:横跨 10 年,大量未公开内容曝光

小众软件 小众软件 · 2026-08-31T06:28:45Z
AQuA:让量化研究 Agent 持续进化,也让回测结果经得起检验

AQuA系统由普林斯顿、蚂蚁和斯坦福团队开发,用于自主量化交易研究。它通过分离数据路径与评价规则,防止数据泄漏和过拟合,使Agent能可靠积累证据。实验显示,因子研究IC达0.190,模型预测IC为0.0843,样本外Sharpe达2.50。该系统强调研究过程的可靠性,而非仅依赖模型智能。

AQuA:让量化研究 Agent 持续进化,也让回测结果经得起检验

量子位 量子位 · 2026-08-31T03:01:29Z

在金融时间序列分析中,传统的K折交叉验证可能导致数据泄漏,影响模型在实盘中的表现。由于金融数据的序列依赖性和市场结构变化,需采用Walk-Forward和Purged K-Fold等方法进行时间序列切分。本文探讨了交叉验证的误区、标签泄漏的类型及修复方法,并提供了Python实现框架,强调风险提示与适用范围。

【量化交易】Walk-forward 与 Purged CV:时间序列正确切分

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-05-01T00:00:00Z
提升时间序列模型性能的五种交叉验证方法

本文介绍了五种交叉验证方法,以提升时间序列模型的性能。这些方法包括前向验证以模拟真实部署、比较扩展和滑动窗口以测试记忆深度、检测时间数据泄漏、评估模型在不同状态下的稳健性,以及基于稳定性调整超参数。这些策略有助于提高模型在实际应用中的可靠性,避免过拟合和数据泄漏。

提升时间序列模型性能的五种交叉验证方法

MachineLearningMastery.com MachineLearningMastery.com · 2026-01-28T11:00:59Z
Hugging Face 开源 FineVision:一个包含 2400 万个样本的全新多模态数据集,用于训练视觉语言模型

Hugging Face 发布了 FineVision,一个包含 1730 万张图片和近 100 亿个答案标记的开放多模态数据集。该数据集经过严格筛选和系统评级,提升了视觉语言模型的训练质量,支持多种新兴任务,减少数据泄漏,推动研究的可重复性和可访问性。

Hugging Face 开源 FineVision:一个包含 2400 万个样本的全新多模态数据集,用于训练视觉语言模型

实时互动网 实时互动网 · 2025-09-08T02:10:58Z
如何诊断回归模型失败的原因

本文探讨了回归模型失败的常见原因及其诊断方法,包括欠拟合、过拟合、数据泄漏、噪声特征、数据预处理不当、超参数设置错误和数据量不足。通过XGBoost模型实例,展示了识别和解决这些问题的方法,以提高预测准确性。

如何诊断回归模型失败的原因

MachineLearningMastery.com MachineLearningMastery.com · 2025-07-31T16:27:21Z
日志关联性

日志关联性是将同一事务或用户会话的日志条目连接的实践。使用关联ID可以追踪用户在分布式系统中的操作路径。Log4j支持MDC,便于在多线程应用中记录上下文信息,需在使用后清除以防数据泄漏。

日志关联性

DEV Community DEV Community · 2025-05-22T13:34:07Z

本文研究了大语言模型(LLMs)在关键行业中的安全性,特别是恶意查询导致的数据泄漏风险。通过建立基准数据集,比较了13种安全工具的有效性,发现Lakera Guard和ProtectAI LLM Guard表现最佳,并提出了改进建议。

评估大语言模型安全解决方案的有效性:Palit基准数据集

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-19T00:00:00Z
我在AI研究中发现的不安真相

作者在情感分类研究中发现,许多AI论文声称方法“无关个体”,但评估技术导致数据泄漏,夸大模型性能。这种误导可能影响开发者的实际应用,损害AI研究的可信度。作者呼吁关注评估方法,倡导诚实报告和严格验证,以确保AI研究的真实进展。

我在AI研究中发现的不安真相

DEV Community DEV Community · 2025-04-05T22:55:47Z

本研究提出了“幻影维基”,旨在解决大型语言模型在推理和检索评估中的数据泄漏问题,生成独特且一致的文档语料库,并提供可扩展的评估框架。

幻影维基:按需生成的推理与检索评估数据集

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-02-27T00:00:00Z

本研究分析了成员推断攻击(MIA)在大语言模型中的局限性,指出合成数据可能导致错误的模型记忆和数据泄漏,强调评估时需谨慎。

Synthetic Data May Mislead Evaluations: Membership Inference as Machine Text Detection

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-01-20T00:00:00Z
💧 📉 💧 你是否在浪费金钱和时间:你的数据是否存在泄漏? 💧 📉 💧

机器学习模型的泛化能力尚不明确,测试集数据泄漏会导致评估错误。新开源功能Leaky-Splits可自动检测和清理数据泄漏,从而提高模型的可信度和评估准确性。

💧 📉 💧 你是否在浪费金钱和时间:你的数据是否存在泄漏? 💧 📉 💧

DEV Community DEV Community · 2024-12-12T17:24:41Z

数据完整性确保数据在生命周期内的准确性、一致性和完整性,防止数据丢失和泄漏,支持准确决策和合规性。

数据完整性为何重要?

DEV Community DEV Community · 2024-10-18T14:08:03Z

苹果提议将网站安全证书有效期缩短至45天,引发争议。美国陆军成立TIAD应对全球信息威胁。芬兰关闭暗网市场“Sipulitie”。思科数据疑似泄漏,大众汽车遭勒索软件攻击。SolarWinds、Kubernetes等曝出漏洞,FIDO联盟简化密钥传输协议。Apache CloudStack修补漏洞。文章还讨论信息安全规划和Java反序列化技术。

FreeBuf早报 | 苹果缩短网站安全证书有效期提案遭反对;思科机密开发数据疑遭模泄漏

FreeBuf网络安全行业门户 FreeBuf网络安全行业门户 · 2024-10-17T03:08:07Z

本研究探讨了大型语言模型(LLM)评估中的数据泄漏和偏见问题,提出了新基准和评估框架,如OR-Bench和LiveBench,以提高评估的可靠性和效率。研究强调模型诚实性的重要性,并通过自动检测方法识别模型弱点,推动LLM性能提升。

自动化语言模型基准测试的作弊问题:无效模型取得高胜率

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-10-09T00:00:00Z

本文介绍了多个多模态基准测试的开发,包括MM-Vet、MMBench和AlignMMBench,旨在评估大型视觉语言模型(VLMs)在复杂任务中的表现。研究强调了人类偏好的重要性,并推出了WildVision-Arena平台以收集反馈。此外,提出了MMStar和MLLM-Bench,以解决数据泄漏和主观性评估的问题,推动多模态智能的发展。

MM-Vet v2:用于评估大型多模态模型综合能力的一个具有挑战性的基准测试

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-08-01T00:00:00Z
为了最赚钱的GTAOL,R星制造了多少牺牲品?

2022年9月,黑客窃取了R星内部文件,包括GTA6的视频片段和GTA5的开发源代码。数据泄漏导致GTA6开发延迟,但核心粉丝可以挖掘GTA5开发背后的故事。然而,R星放弃了线下DLC开发,专注于GTA Online更新,引起玩家失望和对GTA6质量的担忧。

为了最赚钱的GTAOL,R星制造了多少牺牲品?

游戏研究社 游戏研究社 · 2024-07-13T03:30:00Z

这篇文章探讨了大型语言模型(LLMs)的记忆行为及其对隐私的影响。研究发现,模型在训练过程中可能记忆个人可识别信息(PII),并在推理中泄露。为减轻隐私风险,建议采用记忆减轻技术,并强调在模型训练中需谨慎处理数据以保护隐私。

揭开潜在记忆:评估大型语言模型中的数据泄露和记忆模式

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-06-20T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码