GLM-5.3在AI评委的创意写作测试中获全球第二,但人类投票榜未进前十,引发争议。测试由7个LLM评委按16维度打分,GLM-5.3因学会制造冲突而提升,但文笔被指退步。文章质疑AI评AI的可靠性,并指出其编程和安全能力提升显著,但“好故事”标准因AI介入而模糊。
英联邦文学奖多篇获奖作品被确认是AI生成,评委未能识别,暴露出文学界对AI的认知不足。检测工具Pangram的高准确率揭示了AI写作的普遍性。主办方拒绝筛查AI作品,认为信任仍有效,但这种信任已不再适用。文学界需面对现实,接受AI投稿或进行筛查,以保护新作家的机会。
谷歌第17届Doodle比赛主题为“我的超能力是……”,邀请美国K-12学生提交作品。五位入围者各获1万美元奖学金,作品将在谷歌主页展示。投票时间为4月16日至29日,获胜者将获得额外4.5万美元奖学金。评委包括NBA明星Giannis Antetokounmpo和2025年全国年度教师Ashlie Crosson。
瑞士研究表明,小语言模型(SLM)作为代码评委的效果优于大模型,成本仅为其几十分之一。最佳评委为Qwen2.5 Coder 3B,性能显著提升。
OpenAI声称其新模型在国际数学奥林匹克(IMO)中获得金牌,但遭到官方和学界的强烈反对,认为其做法不当。91位评委未参与评分,成绩缺乏官方认证,引发学术道德争议。IMO希望AI公司在闭幕式后公布结果,但OpenAI急于宣布。最终,中国队全员获得金牌,重返世界第一。
消费者技术协会与戛纳电影节合作,为CES 2026设立电影制作与发行奖,旨在表彰电影行业的创新技术与工具,评委来自Cannes Next社区。参赛作品涵盖音视频设备、制作软件、流媒体服务及生成式人工智能等。
清华、复旦和港科大联合发布RM-BENCH基准,旨在评估奖励模型的认知敏锐度,解决“形式大于内容”的问题。该基准关注模型对细微内容差异的敏感性和风格偏差的鲁棒性,涵盖聊天、代码、数学和安全等领域。研究表明,现有奖励模型在这些领域表现不佳,亟需改进。
我最近担任了KendoReact和DEV社区赞助的黑客马拉松评委,这让我对技术竞赛有了新的认识。我分享了参与者和评委的实用建议,以帮助大家更好地准备和理解比赛。
微软开发者挑战赛决赛将于4月23日在北京举行,届时将有顶尖团队和行业专家评审,观众可投票选出获奖团队,并有精美礼品赠送。
快速生成优秀游戏创意的方法是从不同角度思考,挑战传统思维能提高评分。例如,在“组装”主题中,我提出了看不见的化学元素组合的游戏,成功吸引了评委的注意。
新年写作挑战获奖者已公布,评委对参赛者的表现印象深刻,共收到近250份高质量投稿,每个主题选出两位获胜者,获奖者将获得6个月DEV++会员资格及其他奖励。感谢所有参与者!
本周参加了湖南省职业生涯规划大赛,比赛缺乏激励,评委提问尖锐。制作PPT过程艰难,演讲需脱稿,最终表现尚可。同时,辅导员的日常工作让我感受到他们的压力与责任。
参加湖南省职业生涯规划大赛,比赛缺乏激励,评委提问尖锐。制作PPT困难,演讲需脱稿,表现尚可。辅导员的日常工作让我感受到他们的压力与责任。
Tomorrow’s Product Award 是爱范儿设立的年度榜单,旨在发掘具有标杆意义的「明日产品」,涵盖消费电子、智能出行和人工智能领域。评选标准包括创新、改变和普惠,评委认为明日产品应提升沟通效率、拓展认知边界,并解决用户痛点,符合未来需求。完整榜单将于2024年12月公布。
评委工作变得轻松,尝试不戴护膝且未出意外。与大学老师、Apple员工和投资人共同评审项目,尽管观点不同,但认可的项目一致。活动中有许多饭局,我喜欢安静待在角落,偶尔与老朋友聊天放松。明天将翘班,最后一天不参加。
最近状态不佳,晚睡和刷手机影响心情,尤其是小红书。看到抄袭的独立开发者帖子,感慨不赚钱的原因。调研音乐产品发现小众需求,期待与B Team合作。明天将担任移动应用创新赛评委,未来一周将忙于各地活动。
该研究评估了GPT-4在教育反馈中的应用,结果显示57.4%的用户认为其反馈有帮助,尤其在编程教育中表现突出。GPT-4能够有效识别代码错误并提供结构化反馈,但仍需改进以避免误导信息。此外,研究探讨了其在课堂对话分析和教育材料生成中的潜力,显示出与人工评估高度一致性。
WitAwards 2022线下颁奖盛典将于11月16日在「CIS2022网络安全创新大会」上海主会场隆重举行。
完成下面两步后,将自动完成登录并继续当前操作。