mirror of https://lore.kernel.org/lkml/
 help / color / mirror / Atom feed
* [PATCH v3 0/2] drm/xe/nvm: add survivabilty partiton
@ 2026-09-30 14:14 Alexander Usyskin
  2026-09-30 14:14 ` [PATCH v3 1/2] mtd: mtd_intel_dg: add survivability partition Alexander Usyskin
  2026-09-30 14:14 ` [PATCH v3 2/2] drm/xe/nvm: define survivabilty partition Alexander Usyskin
  0 siblings, 2 replies; 5+ messages in thread
From: Alexander Usyskin @ 2026-09-30 14:14 UTC (permalink / raw)
  To: Miquel Raynal, Richard Weinberger, Vignesh Raghavendra,
	Matthew Brost, Thomas Hellström, Rodrigo Vivi, David Airlie,
	Simona Vetter
  Cc: linux-mtd, linux-kernel, intel-xe, dri-devel, Menachem Adin,
	Alexander Usyskin

One of the reasons for the CRI to enter survivability mode
is corrupted storage.
A corrupted storage partition table can make recovery impossible.
A new partition with a pre-defined size, covering the entire storage,
should replace partitions detected from the storage when the card is
in survivability mode to allow a full memory update.

This series intended to be merged via drm tree for consistency
and requires ack from MTD maintainer.

Signed-off-by: Alexander Usyskin <alexander.usyskin@intel.com>
---
Changes in v3:
- Fix minor checkpatch complain
- Add Miquel ack
- Link to v2: https://lore.kernel.org/r/20260916-cri_surviv-v2-0-7de1b5328204@intel.com

Changes in v2:
- Replace usual partitions with survivability one instead of adding
  addition partition to avoid problems with two partitons pointing to
  the same memory area.
- The change is in the mtd part; Miquel, I feel that this requires
  re-review/ack from your side.
- Link to v1: https://lore.kernel.org/r/20260715-cri_surviv-v1-0-61763a6f1076@intel.com

---
Alexander Usyskin (2):
      mtd: mtd_intel_dg: add survivability partition
      drm/xe/nvm: define survivabilty partition

 drivers/gpu/drm/xe/xe_nvm.c        | 13 ++++++--
 drivers/mtd/devices/mtd_intel_dg.c | 65 ++++++++++++++++++++++++++++----------
 include/linux/intel_dg_nvm_aux.h   |  1 +
 3 files changed, 60 insertions(+), 19 deletions(-)
---
base-commit: 3fc93d311249d5ad969a520dd3aae73bc007d431
change-id: 20260715-cri_surviv-5a6faf7586f1

Best regards,
-- 
Alexander Usyskin <alexander.usyskin@intel.com>


^ permalink raw reply	[flat|nested] 5+ messages in thread

* [PATCH v3 1/2] mtd: mtd_intel_dg: add survivability partition
  2026-09-30 14:14 [PATCH v3 0/2] drm/xe/nvm: add survivabilty partiton Alexander Usyskin
@ 2026-09-30 14:14 ` Alexander Usyskin
  2026-10-08 16:42   ` Rodrigo Vivi
  2026-09-30 14:14 ` [PATCH v3 2/2] drm/xe/nvm: define survivabilty partition Alexander Usyskin
  1 sibling, 1 reply; 5+ messages in thread
From: Alexander Usyskin @ 2026-09-30 14:14 UTC (permalink / raw)
  To: Miquel Raynal, Richard Weinberger, Vignesh Raghavendra,
	Matthew Brost, Thomas Hellström, Rodrigo Vivi, David Airlie,
	Simona Vetter
  Cc: linux-mtd, linux-kernel, intel-xe, dri-devel, Menachem Adin,
	Alexander Usyskin

Add option to expose additional fixed-sized partition starting
from the beginning of storage.
Xe driver can request this partition exposure if firmware or hardware
have detected failure that may involve corrupted partition table.
Fixed-sized partition allows full storage re-write in this situation.

Acked-by: Miquel Raynal <miquel.raynal@bootlin.com>
Signed-off-by: Alexander Usyskin <alexander.usyskin@intel.com>
---
 drivers/mtd/devices/mtd_intel_dg.c | 65 ++++++++++++++++++++++++++++----------
 include/linux/intel_dg_nvm_aux.h   |  1 +
 2 files changed, 50 insertions(+), 16 deletions(-)

diff --git a/drivers/mtd/devices/mtd_intel_dg.c b/drivers/mtd/devices/mtd_intel_dg.c
index a566e86eb5e3..976246e94e79 100644
--- a/drivers/mtd/devices/mtd_intel_dg.c
+++ b/drivers/mtd/devices/mtd_intel_dg.c
@@ -31,6 +31,7 @@ struct intel_dg_nvm {
 	void __iomem *base;
 	void __iomem *base2;
 	bool non_posted_erase;
+	bool survivability_enabled;
 
 	size_t size;
 	unsigned int nregions;
@@ -430,6 +431,15 @@ static int intel_dg_nvm_init(struct intel_dg_nvm *nvm, struct device *device,
 	/* clean error register, previous errors are ignored */
 	idg_nvm_error(nvm);
 
+	if (nvm->survivability_enabled) {
+		nvm->size = nvm->regions[0].offset + nvm->regions[0].size - 1;
+		dev_dbg(device, "Registered survivability region %s size=%lld\n",
+			nvm->regions[0].name,
+			nvm->regions[0].size);
+		n = 1;
+		goto out;
+	}
+
 	ret = idg_nvm_is_valid(nvm);
 	if (ret) {
 		dev_err(device, "The MEM is not valid %d\n", ret);
@@ -481,6 +491,7 @@ static int intel_dg_nvm_init(struct intel_dg_nvm *nvm, struct device *device,
 			n++;
 	}
 
+out:
 	nvm->non_posted_erase = non_posted_erase;
 
 	dev_dbg(device, "Registered %d regions\n", n);
@@ -753,15 +764,19 @@ static int intel_dg_mtd_probe(struct auxiliary_device *aux_dev,
 
 	device = &aux_dev->dev;
 
-	/* count available regions */
-	for (nregions = 0, i = 0; i < INTEL_DG_NVM_REGIONS; i++) {
-		if (invm->regions[i].name)
-			nregions++;
-	}
+	if (invm->survivability_size) {
+		nregions = 1;
+	} else {
+		/* count available regions */
+		for (nregions = 0, i = 0; i < INTEL_DG_NVM_REGIONS; i++) {
+			if (invm->regions[i].name)
+				nregions++;
+		}
 
-	if (!nregions) {
-		dev_err(device, "no regions defined\n");
-		return -ENODEV;
+		if (!nregions) {
+			dev_err(device, "no regions defined\n");
+			return -ENODEV;
+		}
 	}
 
 	nvm = kzalloc_flex(*nvm, regions, nregions);
@@ -771,21 +786,39 @@ static int intel_dg_mtd_probe(struct auxiliary_device *aux_dev,
 	kref_init(&nvm->refcnt);
 	mutex_init(&nvm->lock);
 	nvm->nregions = nregions;
+	nvm->survivability_enabled = !!invm->survivability_size;
 
-	for (n = 0, i = 0; i < INTEL_DG_NVM_REGIONS; i++) {
-		if (!invm->regions[i].name)
-			continue;
-
+	if (invm->survivability_size) { /* survivability partition */
 		char *name = kasprintf(GFP_KERNEL, "%s.%s",
-				       dev_name(&aux_dev->dev), invm->regions[i].name);
+				       dev_name(&aux_dev->dev), "DATA");
 		if (!name) {
 			ret = -ENOMEM;
 			goto err_norpm;
 		}
 
-		nvm->regions[n].name = name;
-		nvm->regions[n].id = i;
-		n++;
+		nvm->regions[0].name = name;
+		nvm->regions[0].id = 0;
+		nvm->regions[0].offset  = 0;
+		nvm->regions[0].size = invm->survivability_size;
+		nvm->regions[0].is_readable = true;
+		nvm->regions[0].is_writable = true;
+		n = 1;
+	} else {
+		for (n = 0, i = 0; i < INTEL_DG_NVM_REGIONS; i++) {
+			if (!invm->regions[i].name)
+				continue;
+
+			char *name = kasprintf(GFP_KERNEL, "%s.%s",
+					       dev_name(&aux_dev->dev), invm->regions[i].name);
+			if (!name) {
+				ret = -ENOMEM;
+				goto err_norpm;
+			}
+
+			nvm->regions[n].name = name;
+			nvm->regions[n].id = i;
+			n++;
+		}
 	}
 
 	ret = devm_pm_runtime_enable(device);
diff --git a/include/linux/intel_dg_nvm_aux.h b/include/linux/intel_dg_nvm_aux.h
index 625d46a6b96e..84b5b6e0c4ea 100644
--- a/include/linux/intel_dg_nvm_aux.h
+++ b/include/linux/intel_dg_nvm_aux.h
@@ -21,6 +21,7 @@ struct intel_dg_nvm_dev {
 	struct auxiliary_device aux_dev;
 	bool writable_override;
 	bool non_posted_erase;
+	size_t survivability_size;
 	struct resource bar;
 	struct resource bar2;
 	const struct intel_dg_nvm_region *regions;

-- 
2.53.0


^ permalink raw reply	[flat|nested] 5+ messages in thread

* [PATCH v3 2/2] drm/xe/nvm: define survivabilty partition
  2026-09-30 14:14 [PATCH v3 0/2] drm/xe/nvm: add survivabilty partiton Alexander Usyskin
  2026-09-30 14:14 ` [PATCH v3 1/2] mtd: mtd_intel_dg: add survivability partition Alexander Usyskin
@ 2026-09-30 14:14 ` Alexander Usyskin
  2026-10-08 16:43   ` Rodrigo Vivi
  1 sibling, 1 reply; 5+ messages in thread
From: Alexander Usyskin @ 2026-09-30 14:14 UTC (permalink / raw)
  To: Miquel Raynal, Richard Weinberger, Vignesh Raghavendra,
	Matthew Brost, Thomas Hellström, Rodrigo Vivi, David Airlie,
	Simona Vetter
  Cc: linux-mtd, linux-kernel, intel-xe, dri-devel, Menachem Adin,
	Alexander Usyskin

Define 8M survivability partition for CRI when
storage is open for write override.

Signed-off-by: Alexander Usyskin <alexander.usyskin@intel.com>
---
 drivers/gpu/drm/xe/xe_nvm.c | 13 ++++++++++---
 1 file changed, 10 insertions(+), 3 deletions(-)

diff --git a/drivers/gpu/drm/xe/xe_nvm.c b/drivers/gpu/drm/xe/xe_nvm.c
index 51a1a431ad85..783c3103a8a4 100644
--- a/drivers/gpu/drm/xe/xe_nvm.c
+++ b/drivers/gpu/drm/xe/xe_nvm.c
@@ -56,10 +56,11 @@ static bool xe_nvm_non_posted_erase(struct xe_device *xe)
 	}
 }
 
-static bool xe_nvm_writable_override(struct xe_device *xe)
+static bool xe_nvm_writable_override(struct xe_device *xe, size_t *survivability_size)
 {
 	struct xe_mmio *mmio = xe_root_tile_mmio(xe);
 	bool writable_override;
+	size_t s_size = 0;
 	struct xe_reg reg;
 	u32 test_bit, test_val;
 
@@ -68,6 +69,7 @@ static bool xe_nvm_writable_override(struct xe_device *xe)
 		reg = PCODE_SCRATCH(0);
 		test_bit = FDO_MODE;
 		test_val = FDO_MODE;
+		s_size = SZ_8M;
 		break;
 	case XE_BATTLEMAGE:
 		reg = HECI_FWSTS2(DG2_GSC_HECI2_BASE);
@@ -91,12 +93,17 @@ static bool xe_nvm_writable_override(struct xe_device *xe)
 		break;
 	default:
 		drm_err(&xe->drm, "Unknown platform\n");
+		*survivability_size = 0;
 		return true;
 	}
 
 	writable_override = (xe_mmio_read32(mmio, reg) & test_bit) == test_val;
-	if (writable_override)
+	if (writable_override) {
 		drm_info(&xe->drm, "NVM access overridden by jumper\n");
+		*survivability_size = s_size;
+	} else {
+		*survivability_size = 0;
+	}
 	return writable_override;
 }
 
@@ -143,7 +150,7 @@ int xe_nvm_init(struct xe_device *xe)
 	if (!nvm)
 		return -ENOMEM;
 
-	nvm->writable_override = xe_nvm_writable_override(xe);
+	nvm->writable_override = xe_nvm_writable_override(xe, &nvm->survivability_size);
 	nvm->non_posted_erase = xe_nvm_non_posted_erase(xe);
 	nvm->bar.parent = &pdev->resource[0];
 	nvm->bar.start = GEN12_GUNIT_NVM_BASE + pdev->resource[0].start;

-- 
2.53.0


^ permalink raw reply	[flat|nested] 5+ messages in thread

* Re: [PATCH v3 1/2] mtd: mtd_intel_dg: add survivability partition
  2026-09-30 14:14 ` [PATCH v3 1/2] mtd: mtd_intel_dg: add survivability partition Alexander Usyskin
@ 2026-10-08 16:42   ` Rodrigo Vivi
  0 siblings, 0 replies; 5+ messages in thread
From: Rodrigo Vivi @ 2026-10-08 16:42 UTC (permalink / raw)
  To: Alexander Usyskin
  Cc: Miquel Raynal, Richard Weinberger, Vignesh Raghavendra,
	Matthew Brost, Thomas Hellström, David Airlie,
	Simona Vetter, linux-mtd, linux-kernel, intel-xe, dri-devel,
	Menachem Adin

On Wed, Sep 30, 2026 at 05:14:46PM +0300, Alexander Usyskin wrote:
> Add option to expose additional fixed-sized partition starting
> from the beginning of storage.
> Xe driver can request this partition exposure if firmware or hardware
> have detected failure that may involve corrupted partition table.
> Fixed-sized partition allows full storage re-write in this situation.
> 
> Acked-by: Miquel Raynal <miquel.raynal@bootlin.com>
> Signed-off-by: Alexander Usyskin <alexander.usyskin@intel.com>
> ---
>  drivers/mtd/devices/mtd_intel_dg.c | 65 ++++++++++++++++++++++++++++----------
>  include/linux/intel_dg_nvm_aux.h   |  1 +
>  2 files changed, 50 insertions(+), 16 deletions(-)
> 
> diff --git a/drivers/mtd/devices/mtd_intel_dg.c b/drivers/mtd/devices/mtd_intel_dg.c
> index a566e86eb5e3..976246e94e79 100644
> --- a/drivers/mtd/devices/mtd_intel_dg.c
> +++ b/drivers/mtd/devices/mtd_intel_dg.c
> @@ -31,6 +31,7 @@ struct intel_dg_nvm {
>  	void __iomem *base;
>  	void __iomem *base2;
>  	bool non_posted_erase;
> +	bool survivability_enabled;
>  
>  	size_t size;
>  	unsigned int nregions;
> @@ -430,6 +431,15 @@ static int intel_dg_nvm_init(struct intel_dg_nvm *nvm, struct device *device,
>  	/* clean error register, previous errors are ignored */
>  	idg_nvm_error(nvm);
>  
> +	if (nvm->survivability_enabled) {
> +		nvm->size = nvm->regions[0].offset + nvm->regions[0].size - 1;

I see that this offset + region.size - 1 is also used in idg_nvm_get_region()
we could perhaps define a variable with this and document the - 1?!

But it looks right, no blocker...

> +		dev_dbg(device, "Registered survivability region %s size=%lld\n",
> +			nvm->regions[0].name,
> +			nvm->regions[0].size);
> +		n = 1;
> +		goto out;
> +	}
> +
>  	ret = idg_nvm_is_valid(nvm);
>  	if (ret) {
>  		dev_err(device, "The MEM is not valid %d\n", ret);
> @@ -481,6 +491,7 @@ static int intel_dg_nvm_init(struct intel_dg_nvm *nvm, struct device *device,
>  			n++;
>  	}
>  
> +out:
>  	nvm->non_posted_erase = non_posted_erase;
>  
>  	dev_dbg(device, "Registered %d regions\n", n);
> @@ -753,15 +764,19 @@ static int intel_dg_mtd_probe(struct auxiliary_device *aux_dev,
>  
>  	device = &aux_dev->dev;
>  
> -	/* count available regions */
> -	for (nregions = 0, i = 0; i < INTEL_DG_NVM_REGIONS; i++) {
> -		if (invm->regions[i].name)
> -			nregions++;
> -	}
> +	if (invm->survivability_size) {
> +		nregions = 1;
> +	} else {
> +		/* count available regions */
> +		for (nregions = 0, i = 0; i < INTEL_DG_NVM_REGIONS; i++) {
> +			if (invm->regions[i].name)
> +				nregions++;
> +		}
>  
> -	if (!nregions) {
> -		dev_err(device, "no regions defined\n");
> -		return -ENODEV;
> +		if (!nregions) {
> +			dev_err(device, "no regions defined\n");
> +			return -ENODEV;
> +		}
>  	}
>  
>  	nvm = kzalloc_flex(*nvm, regions, nregions);
> @@ -771,21 +786,39 @@ static int intel_dg_mtd_probe(struct auxiliary_device *aux_dev,
>  	kref_init(&nvm->refcnt);
>  	mutex_init(&nvm->lock);
>  	nvm->nregions = nregions;
> +	nvm->survivability_enabled = !!invm->survivability_size;
>  
> -	for (n = 0, i = 0; i < INTEL_DG_NVM_REGIONS; i++) {
> -		if (!invm->regions[i].name)
> -			continue;
> -
> +	if (invm->survivability_size) { /* survivability partition */
>  		char *name = kasprintf(GFP_KERNEL, "%s.%s",
> -				       dev_name(&aux_dev->dev), invm->regions[i].name);
> +				       dev_name(&aux_dev->dev), "DATA");
>  		if (!name) {
>  			ret = -ENOMEM;
>  			goto err_norpm;
>  		}
>  
> -		nvm->regions[n].name = name;
> -		nvm->regions[n].id = i;
> -		n++;
> +		nvm->regions[0].name = name;
> +		nvm->regions[0].id = 0;
> +		nvm->regions[0].offset  = 0;
> +		nvm->regions[0].size = invm->survivability_size;
> +		nvm->regions[0].is_readable = true;
> +		nvm->regions[0].is_writable = true;
> +		n = 1;
> +	} else {
> +		for (n = 0, i = 0; i < INTEL_DG_NVM_REGIONS; i++) {
> +			if (!invm->regions[i].name)
> +				continue;
> +
> +			char *name = kasprintf(GFP_KERNEL, "%s.%s",
> +					       dev_name(&aux_dev->dev), invm->regions[i].name);
> +			if (!name) {
> +				ret = -ENOMEM;
> +				goto err_norpm;
> +			}
> +
> +			nvm->regions[n].name = name;
> +			nvm->regions[n].id = i;
> +			n++;
> +		}

here as well, I believe the if survivability block should only select the
different print name and fix the for delimiter to 1 iteraction, then
you don't duplicate the rest of the code...
but also no blocker from my side:

Reviewed-by: Rodrigo Vivi <rodrigo.vivi@intel.com>

>  	}
>  
>  	ret = devm_pm_runtime_enable(device);
> diff --git a/include/linux/intel_dg_nvm_aux.h b/include/linux/intel_dg_nvm_aux.h
> index 625d46a6b96e..84b5b6e0c4ea 100644
> --- a/include/linux/intel_dg_nvm_aux.h
> +++ b/include/linux/intel_dg_nvm_aux.h
> @@ -21,6 +21,7 @@ struct intel_dg_nvm_dev {
>  	struct auxiliary_device aux_dev;
>  	bool writable_override;
>  	bool non_posted_erase;
> +	size_t survivability_size;
>  	struct resource bar;
>  	struct resource bar2;
>  	const struct intel_dg_nvm_region *regions;
> 
> -- 
> 2.53.0
> 

^ permalink raw reply	[flat|nested] 5+ messages in thread

* Re: [PATCH v3 2/2] drm/xe/nvm: define survivabilty partition
  2026-09-30 14:14 ` [PATCH v3 2/2] drm/xe/nvm: define survivabilty partition Alexander Usyskin
@ 2026-10-08 16:43   ` Rodrigo Vivi
  0 siblings, 0 replies; 5+ messages in thread
From: Rodrigo Vivi @ 2026-10-08 16:43 UTC (permalink / raw)
  To: Alexander Usyskin
  Cc: Miquel Raynal, Richard Weinberger, Vignesh Raghavendra,
	Matthew Brost, Thomas Hellström, David Airlie,
	Simona Vetter, linux-mtd, linux-kernel, intel-xe, dri-devel,
	Menachem Adin

On Wed, Sep 30, 2026 at 05:14:47PM +0300, Alexander Usyskin wrote:

typo in the subject, but I will fix while merging it.

Reviewed-by: Rodrigo Vivi <rodrigo.vivi@intel.com>

> Define 8M survivability partition for CRI when
> storage is open for write override.
> 
> Signed-off-by: Alexander Usyskin <alexander.usyskin@intel.com>
> ---
>  drivers/gpu/drm/xe/xe_nvm.c | 13 ++++++++++---
>  1 file changed, 10 insertions(+), 3 deletions(-)
> 
> diff --git a/drivers/gpu/drm/xe/xe_nvm.c b/drivers/gpu/drm/xe/xe_nvm.c
> index 51a1a431ad85..783c3103a8a4 100644
> --- a/drivers/gpu/drm/xe/xe_nvm.c
> +++ b/drivers/gpu/drm/xe/xe_nvm.c
> @@ -56,10 +56,11 @@ static bool xe_nvm_non_posted_erase(struct xe_device *xe)
>  	}
>  }
>  
> -static bool xe_nvm_writable_override(struct xe_device *xe)
> +static bool xe_nvm_writable_override(struct xe_device *xe, size_t *survivability_size)
>  {
>  	struct xe_mmio *mmio = xe_root_tile_mmio(xe);
>  	bool writable_override;
> +	size_t s_size = 0;
>  	struct xe_reg reg;
>  	u32 test_bit, test_val;
>  
> @@ -68,6 +69,7 @@ static bool xe_nvm_writable_override(struct xe_device *xe)
>  		reg = PCODE_SCRATCH(0);
>  		test_bit = FDO_MODE;
>  		test_val = FDO_MODE;
> +		s_size = SZ_8M;
>  		break;
>  	case XE_BATTLEMAGE:
>  		reg = HECI_FWSTS2(DG2_GSC_HECI2_BASE);
> @@ -91,12 +93,17 @@ static bool xe_nvm_writable_override(struct xe_device *xe)
>  		break;
>  	default:
>  		drm_err(&xe->drm, "Unknown platform\n");
> +		*survivability_size = 0;
>  		return true;
>  	}
>  
>  	writable_override = (xe_mmio_read32(mmio, reg) & test_bit) == test_val;
> -	if (writable_override)
> +	if (writable_override) {
>  		drm_info(&xe->drm, "NVM access overridden by jumper\n");
> +		*survivability_size = s_size;
> +	} else {
> +		*survivability_size = 0;
> +	}
>  	return writable_override;
>  }
>  
> @@ -143,7 +150,7 @@ int xe_nvm_init(struct xe_device *xe)
>  	if (!nvm)
>  		return -ENOMEM;
>  
> -	nvm->writable_override = xe_nvm_writable_override(xe);
> +	nvm->writable_override = xe_nvm_writable_override(xe, &nvm->survivability_size);
>  	nvm->non_posted_erase = xe_nvm_non_posted_erase(xe);
>  	nvm->bar.parent = &pdev->resource[0];
>  	nvm->bar.start = GEN12_GUNIT_NVM_BASE + pdev->resource[0].start;
> 
> -- 
> 2.53.0
> 

^ permalink raw reply	[flat|nested] 5+ messages in thread

end of thread, other threads:[~2026-10-08 16:43 UTC | newest]

Thread overview: 5+ messages (download: mbox.gz / follow: Atom feed)
-- links below jump to the message on this page --
2026-09-30 14:14 [PATCH v3 0/2] drm/xe/nvm: add survivabilty partiton Alexander Usyskin
2026-09-30 14:14 ` [PATCH v3 1/2] mtd: mtd_intel_dg: add survivability partition Alexander Usyskin
2026-10-08 16:42   ` Rodrigo Vivi
2026-09-30 14:14 ` [PATCH v3 2/2] drm/xe/nvm: define survivabilty partition Alexander Usyskin
2026-10-08 16:43   ` Rodrigo Vivi

This is a public inbox, see mirroring instructions
for how to clone and mirror all data and code used for this inbox

all inboxes | Powered by JetHome®