AOTInductor支持输入张量的原地修改,通过显式使用如`x.mul_(2)`的原地操作,经`torch.export`导出和分解后,输入修改会被记录在`user_inputs_to_mutate`中,编译后的引擎能高效执行原地修改,避免复制大张量。相比之下,修改注册缓冲区可能导致多线程安全问题,因此推荐使用输入修改方式。
完成下面两步后,将自动完成登录并继续当前操作。