内容提要
JetBrains Junie现已支持Google最新编码模型Gemini 3.8 Flash,该模型专为多步骤工程任务设计,通过分解子任务、运行测试和验证来确保答案可靠,虽每步较慢但整体更快。在DeepSWE v1.1基准测试中表现优于多数大型模型且成本更低。限时提供75%折扣,用户可在IDE插件或CLI中直接选用。
延伸解读
按步骤慢,整体快:理解3.8 Flash的取舍
Gemini 3.8 Flash与3.7 Flash的设计思路不同:它不追求单次快速生成,而是通过分解子任务、运行测试和验证来确保结果可靠。这意味着每一步可能更慢,但在复杂多步任务中,最终答案更可靠,整体效率反而更高。如果你的任务只是小修复或简单重构,3.7 Flash仍是更便宜的选择。
基准测试的参考价值
文章引用了DeepSWE v1.1基准测试,该测试专为评估自主智能体在长期真实开发任务中的表现而设计,且避免了数据污染。测试显示3.8 Flash在性能上优于多数大型前沿模型,同时成本更低。但请注意,基准测试结果不代表所有场景,实际效果可能因任务类型而异。
限时折扣与使用方式
JetBrains Junie为Gemini 3.8 Flash提供限时75%折扣,用户可在IDE插件或Junie CLI的模型选择器中直接选用,无需额外设置或等待名单。这一折扣是限时优惠,具体截止时间未在文中说明,建议有需求的用户尽早尝试。
Q&A
Gemini 3.8 Flash 在 Junie 中有何特别之处?
Gemini 3.8 Flash 是 Google 最新的编码模型,专为多步骤工程任务设计,在 Junie 的 IDE 插件和 CLI 中均可使用。它通过分解子任务、运行测试和验证来确保答案可靠,虽然每步较慢,但整体更快。
Gemini 3.8 Flash 与 3.7 Flash 有何不同?
3.7 Flash 注重快速可靠的答案,而 3.8 Flash 采用不同的方法:它花费更多 token 进行探索、重试和验证,通过循环工作:分解目标、编写脚本复现 bug、运行测试并检查更改。因此,3.8 Flash 在复杂多步任务上表现更好,但每步较慢;3.7 Flash 仍可用于简单修复或重构,且每 token 成本更低。
Gemini 3.8 Flash 在 DeepSWE v1.1 基准测试中的表现如何?
根据 Google 的数据,在 DeepSWE v1.1 基准测试中,Gemini 3.8 Flash 的表现优于大多数更大的前沿模型,同时成本显著更低。该基准测试专为测试自主代理在长期真实开发任务中的表现而设计,且无数据污染。
如何以 75% 折扣使用 Gemini 3.8 Flash?
限时优惠期间,在 Junie 的 IDE 插件或 CLI 的模型选择器中选择 Gemini 3.8 Flash 即可使用,无需设置或等待名单。
Gemini 3.8 Flash 的“慢每步,快整体”是什么意思?
这意味着 Gemini 3.8 Flash 在每一步操作上花费更多时间(例如探索目录、重试代码、运行验证),但通过这种额外的谨慎,它减少了返工和错误,从而在整体上更快地给出可靠答案。
Gemini 3.8 Flash 适合哪些任务?
它适合需要多步骤、真实探索的复杂工程任务,例如需要分解子任务、复现 bug、运行测试和验证更改的工作。对于简单的修复或小重构,可能不需要这种额外的谨慎,此时 3.7 Flash 更合适。