From mboxrd@z Thu Jan 1 00:00:00 1970 Received: from mta0.migadu.com (out-146.mta0.migadu.com [91.218.175.146]) (using TLSv1.2 with cipher ECDHE-RSA-AES128-GCM-SHA256 (128/128 bits)) (No client certificate requested) by smtp.subspace.kernel.org (Postfix) with ESMTPS id 9B42E233941 for ; Wed, 19 Aug 2026 12:52:55 +0000 (UTC) Authentication-Results: smtp.subspace.kernel.org; arc=none smtp.client-ip=91.218.175.146 ARC-Seal:i=1; a=rsa-sha256; d=subspace.kernel.org; s=arc-20240116; t=1787143978; cv=none; b=aIUlDXdSQSItITMG5VoOSrACkbd4JIukNiWaBiUUnD2wjeVtMAdRCxGuex+vF/bbKtoG97Qzcy0TC5uRPoTyfI6D5p7Mr9A+swVNObK52LlzhOWhPhHOKDANEPK+pTQAqptNWWXf5GzoFqPzp3IVvty1SAcXMQlc2ZxwwVRUUwA= ARC-Message-Signature:i=1; a=rsa-sha256; d=subspace.kernel.org; s=arc-20240116; t=1787143978; c=relaxed/simple; bh=HlTMRI/PpG3HyZBNnVKwW/n+Ug098qiyebY2UsdtlLA=; h=Message-ID:Date:MIME-Version:Subject:To:Cc:References:From: In-Reply-To:Content-Type; b=QdZjHUbm4At0L9ofoPu4QBNdc1NcDiY2o84OT+l1kAz4bzagftvnfpmrWOe2E8M2RZBsvgjvcrnXUrbg8q83idChVoQQ6/P6vP2uTWkVeSy/lTeZ56AVZfta4bKhb14ES3sQTAKM93oSHyqdCpIOnq8LxobQIhOHBoSSArmgtsw= ARC-Authentication-Results:i=1; smtp.subspace.kernel.org; dmarc=pass (p=none dis=none) header.from=linux.dev; spf=pass smtp.mailfrom=linux.dev; dkim=pass (1024-bit key) header.d=linux.dev header.i=@linux.dev header.b=ITvFyjC8; arc=none smtp.client-ip=91.218.175.146 Authentication-Results: smtp.subspace.kernel.org; dmarc=pass (p=none dis=none) header.from=linux.dev Authentication-Results: smtp.subspace.kernel.org; spf=pass smtp.mailfrom=linux.dev Authentication-Results: smtp.subspace.kernel.org; dkim=pass (1024-bit key) header.d=linux.dev header.i=@linux.dev header.b="ITvFyjC8" X-Envelope-To: linux-kernel@vger.kernel.org DKIM-Signature: a=rsa-sha256; bh=HlTMRI/PpG3HyZBNnVKwW/n+Ug098qiyebY2UsdtlLA=; c=simple/simple; d=linux.dev; h=from:to:subject:date:message-id:mime-version:content-type; s=key1; t=1787143974; v=1; x=1787748774; b=ITvFyjC8yB9GjDtWJm1fvluevvfVvyxKXP3FdxFtaTcRay61gwf7KjcjRZ3cpwucA9Rsbr6d az8+fwdt5QZxfuV2uOTdJVMif+Zx2KCBHS5/IU1ku9XCqZBUu+oMj0W1fe+KyGAztwTmXsizpiV KktXovP8/nCS4HvbDPFJDqBw= X-Envelope-To: linux-kernel@vger.kernel.org Received: from [IPV6:2a03:83e0:1126:4:9d:a05e:5bd8:c200] (2620:10d:c092:500::4:a428) by smtp.migadu.com with ESMTPS id acc26c9af0fdcd3d; Wed, 19 Aug 2026 12:52:53 +0000 X-Migadu-Flow: FLOW_OUT Message-ID: Date: Wed, 19 Aug 2026 13:52:46 +0100 Precedence: bulk X-Mailing-List: linux-kernel@vger.kernel.org List-Id: List-Subscribe: List-Unsubscribe: MIME-Version: 1.0 User-Agent: Mozilla Thunderbird Subject: Re: [PATCH v6 06/12] mm: swap in PMD swap entries as whole THPs during swapoff To: Lance Yang Cc: akpm@linux-foundation.org, david@kernel.org, chrisl@kernel.org, kasong@tencent.com, ljs@kernel.org, ziy@nvidia.com, linux-mm@kvack.org, ying.huang@linux.alibaba.com, baoquan.he@linux.dev, willy@infradead.org, youngjun.park@lge.com, hannes@cmpxchg.org, riel@surriel.com, shakeel.butt@linux.dev, alex@ghiti.fr, kas@kernel.org, baohua@kernel.org, dev.jain@arm.com, baolin.wang@linux.alibaba.com, nico.pache@linux.dev, liam@infradead.org, ryan.roberts@arm.com, vbabka@kernel.org, linux-kernel@vger.kernel.org, nphamcs@gmail.com, shikemeng@huaweicloud.com, yosry@kernel.org, kernel-team@meta.com, linmiaohe@huawei.com References: <20260818131202.494754-7-usama.arif@linux.dev> <20260819053803.15868-1-lance.yang@linux.dev> Content-Language: en-US From: Usama Arif In-Reply-To: <20260819053803.15868-1-lance.yang@linux.dev> Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 7bit On 19/08/2026 06:38, Lance Yang wrote: > +Cc Miaohe > > On Tue, Aug 18, 2026 at 06:09:47AM -0700, Usama Arif wrote: > [...] >> +#ifdef CONFIG_THP_SWAP >> +/* >> + * unuse_pmd - Map a locked folio at PMD granularity during swapoff. >> + * >> + * The caller provides a locked, swapped-in folio. Returns 0 on success >> + * (PMD was mapped). Returns -EAGAIN if the swap cache folio no longer >> + * matches the entry or the PMD changed under the lock (try_to_unuse will >> + * rescan). Returns -EIO if the folio is not uptodate or contains a poisoned >> + * subpage; in that case the PMD is split so unuse_pte_range() can handle >> + * individual pages. >> + */ >> +static int unuse_pmd(struct vm_area_struct *vma, pmd_t *pmd, >> + unsigned long addr, softleaf_t entry, >> + struct folio *folio) >> +{ >> + struct mm_struct *mm = vma->vm_mm; >> + struct page *page; >> + pmd_t new_pmd, old_pmd; >> + spinlock_t *ptl; >> + rmap_t rmap_flags = RMAP_NONE; >> + bool exclusive; >> + >> + if (unlikely(!folio_matches_swap_entry(folio, entry))) >> + return -EAGAIN; >> + >> + if (unlikely(!folio_test_uptodate(folio))) { >> + /* Let PTE fallback reread each slot independently. */ >> + swap_cache_del_folio(folio); >> + __split_huge_pmd(vma, pmd, addr, false); >> + return -EIO; >> + } >> + >> + if (unlikely(folio_contain_hwpoisoned_page(folio))) { >> + /* Let PTE fallback isolate the poisoned subpages. */ >> + __split_huge_pmd(vma, pmd, addr, false); >> + return -EIO; >> + } > > Hmm ... can this miss a poisoned tail? > > memory_failure() sets PageHWPoison(p) before taking folio_lock(), but > PG_has_hwpoisoned is only set later. Since unuse_pmd_entry() holds folio > lock across this check, memory_failure() can be blocked on folio_lock() > with a tail already poisoned, IIUC ... > > folio_contain_hwpoisoned_page() then sees neither a poisoned head nor > PG_has_hwpoisoned, and set_pmd_at() maps that tail through a normal PMD. > > Note that unuse_pte() checks PageHWPoison(page) directly. Should we check > each subpage here as well before installing the PMD? Good catch! I am going to introduce a helper like below and use it in the next revision. Thanks! static inline bool folio_has_hwpoisoned_subpage(struct folio *folio) { unsigned long i; for (i = 0; i < folio_nr_pages(folio); i++) if (PageHWPoison(folio_page(folio, i))) return true; return false; } > >> + >> + page = folio_page(folio, 0); >> + >> + ptl = pmd_lock(mm, pmd); >> + old_pmd = pmdp_get(pmd); >> + >> + if (!pmd_is_swap_entry(old_pmd) || >> + softleaf_from_pmd(old_pmd).val != entry.val) { >> + spin_unlock(ptl); >> + return -EAGAIN; >> + } >> + >> + exclusive = pmd_swp_exclusive(old_pmd); >> + >> + /* >> + * Some architectures may have to restore extra metadata to the folio >> + * when reading from swap. This metadata may be indexed by swap entry >> + * so this must be called before folio_put_swap(). >> + */ >> + arch_swap_restore(folio_swap(entry, folio), folio); >> + >> + add_mm_counter(mm, MM_ANONPAGES, HPAGE_PMD_NR); >> + add_mm_counter(mm, MM_SWAPENTS, -HPAGE_PMD_NR); >> + >> + new_pmd = folio_mk_pmd(folio, vma->vm_page_prot); >> + new_pmd = pmd_mkold(new_pmd); >> + if (pmd_swp_soft_dirty(old_pmd)) >> + new_pmd = pmd_mksoft_dirty(new_pmd); >> + if (pmd_swp_uffd(old_pmd)) >> + new_pmd = pmd_mkuffd(new_pmd); >> + if (pmd_swp_uffd(old_pmd) && userfaultfd_rwp(vma)) >> + new_pmd = pmd_modify(new_pmd, PAGE_NONE); >> + >> + if (exclusive) >> + rmap_flags |= RMAP_EXCLUSIVE; >> + >> + folio_get(folio); >> + if (!folio_test_anon(folio)) >> + folio_add_new_anon_rmap(folio, vma, addr, rmap_flags); >> + else >> + folio_add_anon_rmap_pmd(folio, page, vma, addr, rmap_flags); >> + >> + set_pmd_at(mm, addr, pmd, new_pmd); >> + folio_put_swap(folio, NULL); >> + >> + spin_unlock(ptl); >> + >> + folio_free_swap(folio); >> + return 0; >> +} > > [...] > > Cheers, Lance