From mboxrd@z Thu Jan 1 00:00:00 1970 Received: from mail-ed1-f48.google.com (mail-ed1-f48.google.com [209.85.208.48]) (using TLSv1.2 with cipher ECDHE-RSA-AES128-GCM-SHA256 (128/128 bits)) (No client certificate requested) by smtp.subspace.kernel.org (Postfix) with ESMTPS id 3BEB935C1B7 for ; Sun, 23 Aug 2026 01:03:24 +0000 (UTC) Authentication-Results: smtp.subspace.kernel.org; arc=none smtp.client-ip=209.85.208.48 ARC-Seal:i=1; a=rsa-sha256; d=subspace.kernel.org; s=arc-20240116; t=1787447014; cv=none; b=V0R/CGNJmEFXjqA2aeLTmZH5vlmyy8ZOOM33fDSLVVeYSpteFyaT9BXmn4Ezf+1/EylrK77aLOR6ohM9ozUYFXoTrVT6kZ7BIdj+EtsjKcdRECbmIXCEUmdh/d2WVZTgLsoaMrDSw/jg89NvSaUfztX4QxsJ7HDChlkwE79f/A4= ARC-Message-Signature:i=1; a=rsa-sha256; d=subspace.kernel.org; s=arc-20240116; t=1787447014; c=relaxed/simple; bh=if0IfB/FZmrniK7JspXyAOBk5lRJJqGb/HwfXfJRkxQ=; h=Message-ID:Date:MIME-Version:Subject:To:Cc:References:From: In-Reply-To:Content-Type; b=KVyh/zbNVsY5Li0DAQxFRpCOy9dzuKaMBBe4aTystcWiX2A6q/O1bpXlRz84mFDV1z8+RNOWMfmT/1JhDNm2hcryWPd0hrHD6UXaMcLuD/IbvDYJnwSPGLunxiEf/f2SrfhquwsB7rK4Hn+scyikkV5Gr/9Xp3HjzLj0moKpr4o= ARC-Authentication-Results:i=1; smtp.subspace.kernel.org; dmarc=none (p=none dis=none) header.from=grimberg.me; spf=pass smtp.mailfrom=gmail.com; arc=none smtp.client-ip=209.85.208.48 Authentication-Results: smtp.subspace.kernel.org; dmarc=none (p=none dis=none) header.from=grimberg.me Authentication-Results: smtp.subspace.kernel.org; spf=pass smtp.mailfrom=gmail.com Received: by mail-ed1-f48.google.com with SMTP id 4fb4d7f45d1cf-6a20319d030so3523008a12.2 for ; Sat, 22 Aug 2026 18:03:24 -0700 (PDT) X-Google-DKIM-Signature: v=1; a=rsa-sha256; c=relaxed/relaxed; d=1e100.net; s=20251104; t=1787447001; x=1788051801; h=content-transfer-encoding:content-type:in-reply-to:from :content-language:references:cc:to:subject:user-agent:mime-version :date:message-id:x-gm-gg:x-gm-message-state:from:to:cc:subject:date :message-id:reply-to:content-type; bh=4cOSys9NZHQpHRYWmgnimn/Nu4HZ11el9o5hMuxrQVQ=; b=tHQ9pfR+beP3WnhOIcdbMPbOp/STqHlnvkxlaX3X5HLiFugtlhchVtEvieKVpyIBE8 qWZ105T+5ik4ealoNLFgSRwhoLdD049k5Y/nMWAbuzDRQBP6lgP828jpf8iZgCRtZ9ap dyBXeWXRFDkZOGDlkfbkF637lF084RroX2QScPWofVy3YYPZGBlq7bc3E08NicrCQ72W vAyRxvQUOG/551bF3/zjldatqr2mSVWTix1nUDObhb3amxTziBXbgdZGtO3X2ePvxkE+ 9QXeFbmgvOPEY41Lp/HaUw5OsHNYloAzLm0C9qcOcoqCRtwL5F07+/BcvDAEa6/pZshO 8daA== X-Forwarded-Encrypted: i=1; AHgh+RoAMBaOvGHv75ZSVo3p8HpZe9TcumcK13pHWqNs7528+tN9hSjDdePujgE3d7M+g4y5CNbuQ6RrpKOK+3c=@vger.kernel.org X-Gm-Message-State: AFuF++l8udwplkKbakpQd6qCV5F8ebzGn1tFj1IYSUBr45RQs0l22QID bcpgNMErF8aFpShZ7jWAtHEU0TlM/l5nWvziJTO+wYyoQ8hroymi7uFR X-Gm-Gg: AR+sD10YvJxEL3pNiDiVzAQ7kqizbJ+EuV6Qs7yKgkCraocCJGDlmwJ8Qm7GAFy3Zc7 VDKmt8/uGbjWBMx7/EOXruqf9H4PVRRgujiPTy5/m3aK0zliA5pKAmwFRaLkZcQWGWz4EEzNKz1 SCv+aTQMjH2OsDXvOpStbdl1YCLr7u7M9m60HmqICVfgHDzDmKKsSS0As+b4WREj548FR+Rx9Nt I+IYdSOaRfiOKPm0tjcHuuXlcc8nDI4sFF7IVPWLjzagbrzcz1IRhG+QOPVZz3noKmtC2sWgqj+ MlG1aLZkD3nXhfp1XrRUZDPJMTRHq3NyJn8ViWt/wqtYS7ZatM7JD/qyrRh+jcMqpUgwaU44ouB b1dOGwUmCrZnucWeczW/VpC2FczQg6JGcXoOXNz906s3OMYrBJKWz+qUrbM7MqSHg7ytjgdyb6J cEBB133EyUU6ag7XYvMeUOD0uNrOfRfvFKHQY0p8+ngeANNJTKJNAH4ueH+GqYQcvdlSO3v25F4 4bgk7di19KIBx9tna9m8X4= X-Received: by 2002:a05:6402:320c:b0:6a3:fdb0:c374 with SMTP id 4fb4d7f45d1cf-6a42f2054b1mr19479957a12.13.1787447001285; Sat, 22 Aug 2026 18:03:21 -0700 (PDT) Received: from [10.100.102.74] (89-138-65-240.bb.netvision.net.il. [89.138.65.240]) by smtp.gmail.com with ESMTPSA id 4fb4d7f45d1cf-6a59e19a05bsm695651a12.17.2026.08.22.18.03.19 (version=TLS1_3 cipher=TLS_AES_128_GCM_SHA256 bits=128/128); Sat, 22 Aug 2026 18:03:20 -0700 (PDT) Message-ID: <3bc07e43-750d-4e8d-a209-e1d45acbb230@grimberg.me> Date: Sun, 23 Aug 2026 04:03:18 +0300 Precedence: bulk X-Mailing-List: linux-kernel@vger.kernel.org List-Id: List-Subscribe: List-Unsubscribe: MIME-Version: 1.0 User-Agent: Mozilla Thunderbird Subject: Re: [PATCH v5 10/16] nvme-tcp: Use CCR to recover controller that hits an error To: Mohamed Khalfella , Justin Tee , Naresh Gottumukkala , Paul Ely , Chaitanya Kulkarni , Christoph Hellwig , Jens Axboe , Keith Busch , James Smart , Hannes Reinecke , Randy Jennings , Dhaval Giani Cc: Aaron Dailey , linux-nvme@lists.infradead.org, linux-kernel@vger.kernel.org References: <20260712022437.3743117-1-mkhalfella@purestorage.com> <20260712022437.3743117-11-mkhalfella@purestorage.com> Content-Language: en-US From: Sagi Grimberg In-Reply-To: <20260712022437.3743117-11-mkhalfella@purestorage.com> Content-Type: text/plain; charset=UTF-8; format=flowed Content-Transfer-Encoding: 7bit On 12/07/2026 5:23, Mohamed Khalfella wrote: > An alive nvme controller that hits an error now will move to FENCING > state instead of RESETTING state. ctrl->fencing_work attempts CCR to > terminate inflight IOs. Regardless of the success or failure of CCR > operation the controller is transitioned to RESETTING state to continue > error recovery process. > > Signed-off-by: Mohamed Khalfella > --- > drivers/nvme/host/tcp.c | 30 +++++++++++++++++++++++++++++- > 1 file changed, 29 insertions(+), 1 deletion(-) > > diff --git a/drivers/nvme/host/tcp.c b/drivers/nvme/host/tcp.c > index ba5c7b3e2a7c..a1711dd1d3c2 100644 > --- a/drivers/nvme/host/tcp.c > +++ b/drivers/nvme/host/tcp.c > @@ -161,6 +161,7 @@ struct nvme_tcp_ctrl { > struct sockaddr_storage src_addr; > struct nvme_ctrl ctrl; > > + struct work_struct fencing_work; > struct work_struct err_work; > struct delayed_work connect_work; > struct nvme_tcp_request async_req; > @@ -605,6 +606,12 @@ static void nvme_tcp_init_recv_ctx(struct nvme_tcp_queue *queue) > > static void nvme_tcp_error_recovery(struct nvme_ctrl *ctrl) > { > + if (nvme_change_ctrl_state(ctrl, NVME_CTRL_FENCING)) { > + dev_warn(ctrl->device, "starting controller fencing\n"); > + queue_work(nvme_wq, &to_tcp_ctrl(ctrl)->fencing_work); > + return; > + } > + > if (!nvme_change_ctrl_state(ctrl, NVME_CTRL_RESETTING)) > return; > > @@ -2494,12 +2501,29 @@ static void nvme_tcp_reconnect_ctrl_work(struct work_struct *work) > nvme_tcp_reconnect_or_remove(ctrl, ret); > } > > +static void nvme_tcp_fencing_work(struct work_struct *work) > +{ > + struct nvme_tcp_ctrl *tcp_ctrl = container_of(work, > + struct nvme_tcp_ctrl, fencing_work); > + struct nvme_ctrl *ctrl = &tcp_ctrl->ctrl; > + unsigned long rem; > + > + rem = nvme_fence_ctrl(ctrl); > + if (rem) > + dev_info(ctrl->device, "CCR failed, starting error recovery\n"); > + > + nvme_change_ctrl_state(ctrl, NVME_CTRL_FENCED); > + if (nvme_change_ctrl_state(ctrl, NVME_CTRL_RESETTING)) > + queue_work(nvme_reset_wq, &tcp_ctrl->err_work); > +} > + > static void nvme_tcp_error_recovery_work(struct work_struct *work) > { > struct nvme_tcp_ctrl *tcp_ctrl = container_of(work, > struct nvme_tcp_ctrl, err_work); > struct nvme_ctrl *ctrl = &tcp_ctrl->ctrl; > > + flush_work(&to_tcp_ctrl(ctrl)->fencing_work); Agree we shouldn't be here with fencing work running. > if (nvme_tcp_key_revoke_needed(ctrl)) > nvme_auth_revoke_tls_key(ctrl); > nvme_stop_keep_alive(ctrl); > @@ -2542,6 +2566,7 @@ static void nvme_reset_ctrl_work(struct work_struct *work) > container_of(work, struct nvme_ctrl, reset_work); > int ret; > > + flush_work(&to_tcp_ctrl(ctrl)->fencing_work); Isn't it being called in nvme_stop_ctrl? - perhaps it should be called in ->stop_ctrl() callback. Other than that, this looks reasonable to me.