From mboxrd@z Thu Jan 1 00:00:00 1970 Received: from us-smtp-delivery-124.mimecast.com (us-smtp-delivery-124.mimecast.com [170.10.129.124]) (using TLSv1.2 with cipher ECDHE-RSA-AES256-GCM-SHA384 (256/256 bits)) (No client certificate requested) by smtp.subspace.kernel.org (Postfix) with ESMTPS id C5203375AB8 for ; Wed, 3 Jun 2026 17:40:08 +0000 (UTC) Authentication-Results: smtp.subspace.kernel.org; arc=none smtp.client-ip=170.10.129.124 ARC-Seal:i=1; a=rsa-sha256; d=subspace.kernel.org; s=arc-20240116; t=1780508410; cv=none; b=u1YxDc1kiYpdEVwZJZzKa1k6sKMj+r3nn14Z0EIVVgcalNWQHGYirkM73FXYbZEXI9jdP3hgs50BCmUqiZ/lQ+ZlwG7iFIhjlG6DHUkAKBD+r1HRcW1mu1+VDrxW0WwHgxJB7kUQby8j6+P4dYDu1Wt68UGCvONhNvtAnYE+bBw= ARC-Message-Signature:i=1; a=rsa-sha256; d=subspace.kernel.org; s=arc-20240116; t=1780508410; c=relaxed/simple; bh=YtjvwAv7So+GtRSevvFFLM0raUhO9n3FoS9mSo7MX3k=; h=Message-ID:Date:MIME-Version:Subject:To:Cc:References:From: In-Reply-To:Content-Type; b=cZnzTIKNJEWBCKXeuVQJYrHSRuZ8/9r/WAzDuN8IfoX2EyR7gV6a9k8eLGVNiL+0SMwQYmbidKFZe10tYaxJ8Y4touQzFU+FH4iOTwgL9QRd5ZbP0ImAuswhC+uzAnIQ44jE2131Q6SICWxaDVCrcWMyC+9P1QtjC7QPJGrcGH4= ARC-Authentication-Results:i=1; smtp.subspace.kernel.org; dmarc=pass (p=quarantine dis=none) header.from=redhat.com; spf=pass smtp.mailfrom=redhat.com; dkim=pass (1024-bit key) header.d=redhat.com header.i=@redhat.com header.b=VilZjOGg; arc=none smtp.client-ip=170.10.129.124 Authentication-Results: smtp.subspace.kernel.org; dmarc=pass (p=quarantine dis=none) header.from=redhat.com Authentication-Results: smtp.subspace.kernel.org; spf=pass smtp.mailfrom=redhat.com Authentication-Results: smtp.subspace.kernel.org; dkim=pass (1024-bit key) header.d=redhat.com header.i=@redhat.com header.b="VilZjOGg" DKIM-Signature: v=1; a=rsa-sha256; c=relaxed/relaxed; d=redhat.com; s=mimecast20190719; t=1780508407; h=from:from:reply-to:subject:subject:date:date:message-id:message-id: to:to:cc:cc:mime-version:mime-version:content-type:content-type: content-transfer-encoding:content-transfer-encoding: in-reply-to:in-reply-to:references:references; bh=nGxdjpqe3cr/pic4Bd1eU4ewAXsVZ/j+LFNRpPoH17w=; b=VilZjOGg20vEf/dLLTGvHA89QAKMe4Ra9eXXhsqh2A7A7qbH1CGjVr88x8uZ26tAAA1xuh eUYJBO/o0Mol9iPQUHvI/geApLR5LdFRWDUO/t8So4TDc1P0h0CKO92bIZtuD0+McT3U6Q dDKcNSj/qSH736AeCTLccw+FnMKLqSo= Received: from mail-qk1-f199.google.com (mail-qk1-f199.google.com [209.85.222.199]) by relay.mimecast.com with ESMTP with STARTTLS (version=TLSv1.3, cipher=TLS_AES_256_GCM_SHA384) id us-mta-557-9H8fTuuVOo6ylvWIWpaw3w-1; Wed, 03 Jun 2026 13:40:06 -0400 X-MC-Unique: 9H8fTuuVOo6ylvWIWpaw3w-1 X-Mimecast-MFC-AGG-ID: 9H8fTuuVOo6ylvWIWpaw3w_1780508406 Received: by mail-qk1-f199.google.com with SMTP id af79cd13be357-9157db42dd8so437238085a.2 for ; Wed, 03 Jun 2026 10:40:06 -0700 (PDT) X-Google-DKIM-Signature: v=1; a=rsa-sha256; c=relaxed/relaxed; d=1e100.net; s=20251104; t=1780508406; x=1781113206; h=content-transfer-encoding:in-reply-to:from:content-language :references:cc:to:subject:user-agent:mime-version:date:message-id :x-gm-gg:x-gm-message-state:from:to:cc:subject:date:message-id :reply-to; bh=nGxdjpqe3cr/pic4Bd1eU4ewAXsVZ/j+LFNRpPoH17w=; b=WK1FHS07EWCURbe1KzCkMisxl06K9sCJYe9YIsgtPp+da/kmHS8aQjMV4uFQJUMfv5 AQUKqbXeIew7RrZ5kaV7BsLEyxgNIm5EGCUvpo9bovE73g4E0ScjoxAXROBWXWlmk8Gu HMDFVg9W0OrF0vvs73GoVlMuodZYk5gXBzGtkdG4Es9JUOc/4fhnuARQyTSC080Pyaw5 FbAU/OSxUPcsXH/99tcdwUzVxw1tL6+g2uGwE6d1OJ3QhdLOGPcb+oXWz43rjYAdU02Q SUi7tZAoTq734LzgC7vzAf5WthQk07A0oqErg/u1M55kadB1zI9OqZ9N+tI1yYd7oMMr kXmg== X-Gm-Message-State: AOJu0Yy3ziR9tnXBjDIobjJ6EhvT5cQbl5IOa6onMeDWAaQ/hmIggP0f g8TLWN4S8CNZhea6QbTLM3LUo94IsTgV24O0g6Ayd0PHTycjsNW9+9Hyh+1z27DfTKPRXq/SnIL x4zNkKNXpV5fCLm7ybfGw3VxN+8pKsCamDkAGqh5pky4i3v7FbHNsdoti7VQwdhfDUQ== X-Gm-Gg: Acq92OF3qi7N7CWrMPIm1o+Eqrjyon2sCSukqJRTHrKzbfWQHzwJdTwT7DjOMjixNWO qucFWlOUWx6tNg0TDlrmNJPINzfqMGrwgIn3gbDdUdelApQd5dg9Gri5WUB5fYHMXV3ffFYy5xx ZjbHkmhA7cfG+ddg1nbRjFXNSoiSOnv4KcTKXV9iifd/J8bWTAQAcWfvMP+YQS5q12SyrG+j7b0 MYx4aG4eYNF4ZwF8skmI7vefzEdA6HKuwXOeU22l3x+wIKcQ2YryKRueWIHbazlHwJBoFYnaojK RU9uBng43aueLEU3kjWjF86aAi4+MrEb1CAoYVMk6scDWNk5PiulRhHZiqlNTO5QJNj6CLrSRIc MOvlOs0AEEZXIErUrCHkJ5YTT7Gi7c2R++TomBS9SlQ9e66DGwM5HwcCIH6sgXdr6AWjiBQAbKJ 8p2hP4qYIsClD/7Z9XFvYE6YE= X-Received: by 2002:a05:620a:6908:b0:912:c0b3:7d99 with SMTP id af79cd13be357-9158a674e2fmr740796185a.2.1780508405593; Wed, 03 Jun 2026 10:40:05 -0700 (PDT) X-Received: by 2002:a05:620a:6908:b0:912:c0b3:7d99 with SMTP id af79cd13be357-9158a674e2fmr740790485a.2.1780508405121; Wed, 03 Jun 2026 10:40:05 -0700 (PDT) Received: from [192.168.2.110] (bras-base-aylmpq0104w-grc-22-70-53-202-134.dsl.bell.ca. [70.53.202.134]) by smtp.gmail.com with ESMTPSA id 6a1803df08f44-8cecd06b231sm26386306d6.33.2026.06.03.10.40.03 (version=TLS1_3 cipher=TLS_AES_128_GCM_SHA256 bits=128/128); Wed, 03 Jun 2026 10:40:04 -0700 (PDT) Message-ID: <710692d6-27e7-434e-a308-e717793d4fce@redhat.com> Date: Wed, 3 Jun 2026 13:40:03 -0400 Precedence: bulk X-Mailing-List: linux-kernel@vger.kernel.org List-Id: List-Subscribe: List-Unsubscribe: MIME-Version: 1.0 User-Agent: Mozilla Thunderbird Subject: Re: [PATCH v5 14/14] mm: thp: always enable mTHP support To: Lance Yang , Nico Pache Cc: linux-kernel@vger.kernel.org, linux-mm@kvack.org, david@kernel.org, baolin.wang@linux.alibaba.com, ziy@nvidia.com, corbet@lwn.net, tsbogend@alpha.franken.de, maddy@linux.ibm.com, mpe@ellerman.id.au, agordeev@linux.ibm.com, gerald.schaefer@linux.ibm.com, hca@linux.ibm.com, gor@linux.ibm.com, x86@kernel.org, tglx@kernel.org, mingo@redhat.com, bp@alien8.de, ira.weiny@intel.com, hughd@google.com, dave.hansen@linux.intel.com, djbw@kernel.org, vishal.l.verma@intel.com, dave.jiang@intel.com, akpm@linux-foundation.org, yintirui@huawei.com, ljs@kernel.org References: <8781a9a0f115705ee11884ed3184b65a1ce39923.1780066530.git.luizcap@redhat.com> <20260603081207.1375-1-lance.yang@linux.dev> Content-Language: en-US, en-CA From: Luiz Capitulino In-Reply-To: <20260603081207.1375-1-lance.yang@linux.dev> Content-Type: text/plain; charset=UTF-8; format=flowed Content-Transfer-Encoding: 7bit On 2026-06-03 04:12, Lance Yang wrote: > Would it makes sense to call khugepaged_enter_vma() for anon mTHP faults > as well? > > vm_fault_t do_huge_pmd_anonymous_page(struct vm_fault *vmf) > { > [...] > if (!thp_vma_suitable_order(vma, haddr, PMD_ORDER)) > return VM_FAULT_FALLBACK; > [...] > khugepaged_enter_vma(vma, vma->vm_flags); > [...] > } > > Without PMD leaves, do_huge_pmd_anonymous_page() is not reached. Apart > from MADV_HUGEPAGE, AFAIK, the mm has no chance to enter khugepaged > from the fault side :) Hey Lance, Wouldn't we also skip do_huge_pmd_anonymous_page() page today if PMD-sized THPs are disabled in sysfs but mTHP is enabled? In any case, by reading through khugepaged_enter_vma() I see that khugepaged only supports PMD-size for now. So, shouldn't this case be addressed in Nico's series [1] ? [1] https://lore.kernel.org/linux-mm/20260522150009.121603-1-npache@redhat.com/ > > Cheers, Lance > > On Fri, May 29, 2026 at 10:55:32AM -0400, Luiz Capitulino wrote: >> If PMD-sized pages are not supported on an architecture (ie. the >> arch implements arch_has_pmd_leaves() and it returns false) then the >> current code disables all THP, including mTHP. >> >> This commit fixes this by allowing mTHP to be always enabled for all >> archs. When PMD-sized pages are not supported, its sysfs entry won't be >> created and their mapping will be disallowed at page-fault time. >> >> Similarly, this commit implements the following changes for shmem in >> shmem_allowable_huge_orders(): >> >> - Drop the pgtable_has_pmd_leaves() check so that mTHP sizes are >> considered >> - Filter out PMD and PUD orders from allowable orders when >> PMD-sized pages are not supported by the CPU >> >> Signed-off-by: Luiz Capitulino >> --- >> mm/huge_memory.c | 25 ++++++++++++++++++++----- >> mm/shmem.c | 14 +++++++++----- >> 2 files changed, 29 insertions(+), 10 deletions(-) >> >> diff --git a/mm/huge_memory.c b/mm/huge_memory.c >> index 32254febe097..059901a8c6cb 100644 >> --- a/mm/huge_memory.c >> +++ b/mm/huge_memory.c >> @@ -126,6 +126,15 @@ unsigned long __thp_vma_allowable_orders(struct vm_area_struct *vma, >> else >> supported_orders = THP_ORDERS_ALL_FILE_DEFAULT; >> >> + if (!pgtable_has_pmd_leaves()) { >> + /* >> + * If the CPU does not support PMD leaves, assume for >> + * now that it does not support PUD leaves and disable >> + * both folio orders. >> + */ >> + supported_orders &= ~(BIT(PMD_ORDER) | BIT(PUD_ORDER)); >> + } >> + >> orders &= supported_orders; >> if (!orders) >> return 0; >> @@ -133,7 +142,7 @@ unsigned long __thp_vma_allowable_orders(struct vm_area_struct *vma, >> if (!vma->vm_mm) /* vdso */ >> return 0; >> >> - if (!pgtable_has_pmd_leaves() || vma_thp_disabled(vma, vm_flags, forced_collapse)) >> + if (vma_thp_disabled(vma, vm_flags, forced_collapse)) >> return 0; >> >> /* khugepaged doesn't collapse DAX vma, but page fault is fine. */ >> @@ -848,7 +857,7 @@ static int __init hugepage_init_sysfs(struct kobject **hugepage_kobj) >> * disable all other sizes. powerpc's PMD_ORDER isn't a compile-time >> * constant so we have to do this here. >> */ >> - if (!anon_orders_configured) >> + if (!anon_orders_configured && pgtable_has_pmd_leaves()) >> huge_anon_orders_inherit = BIT(PMD_ORDER); >> >> *hugepage_kobj = kobject_create_and_add("transparent_hugepage", mm_kobj); >> @@ -870,6 +879,15 @@ static int __init hugepage_init_sysfs(struct kobject **hugepage_kobj) >> } >> >> orders = THP_ORDERS_ALL_ANON | THP_ORDERS_ALL_FILE_DEFAULT; >> + if (!pgtable_has_pmd_leaves()) { >> + /* >> + * If the CPU does not support PMD leaves, assume for >> + * now that it does not support PUD leaves and disable >> + * both folio orders. >> + */ >> + orders &= ~(BIT(PMD_ORDER) | BIT(PUD_ORDER)); >> + } >> + >> order = highest_order(orders); >> while (orders) { >> thpsize = thpsize_create(order, *hugepage_kobj); >> @@ -969,9 +987,6 @@ static int __init hugepage_init(void) >> int err; >> struct kobject *hugepage_kobj; >> >> - if (!pgtable_has_pmd_leaves()) >> - return -EINVAL; >> - >> /* >> * hugepages can't be allocated by the buddy allocator >> */ >> diff --git a/mm/shmem.c b/mm/shmem.c >> index 079e299ea789..c15dffd0eb41 100644 >> --- a/mm/shmem.c >> +++ b/mm/shmem.c >> @@ -1844,16 +1844,19 @@ unsigned long shmem_allowable_huge_orders(struct inode *inode, >> unsigned long mask = READ_ONCE(huge_shmem_orders_always); >> unsigned long within_size_orders = READ_ONCE(huge_shmem_orders_within_size); >> vm_flags_t vm_flags = vma ? vma->vm_flags : 0; >> - unsigned int global_orders; >> + unsigned int global_orders, disabled_orders = 0; >> >> - if (!pgtable_has_pmd_leaves() || (vma && vma_thp_disabled(vma, vm_flags, shmem_huge_force))) >> + if (vma && vma_thp_disabled(vma, vm_flags, shmem_huge_force)) >> return 0; >> >> + if (!pgtable_has_pmd_leaves()) >> + disabled_orders = BIT(PMD_ORDER); >> + >> global_orders = shmem_huge_global_enabled(inode, index, write_end, >> shmem_huge_force, vma, vm_flags); >> /* Tmpfs huge pages allocation */ >> if (!vma || !vma_is_anon_shmem(vma)) >> - return global_orders; >> + return global_orders & ~disabled_orders; >> >> /* >> * Following the 'deny' semantics of the top level, force the huge >> @@ -1867,7 +1870,7 @@ unsigned long shmem_allowable_huge_orders(struct inode *inode, >> * means non-PMD sized THP can not override 'huge' mount option now. >> */ >> if (shmem_huge == SHMEM_HUGE_FORCE) >> - return READ_ONCE(huge_shmem_orders_inherit); >> + return READ_ONCE(huge_shmem_orders_inherit) & ~disabled_orders; >> >> /* Allow mTHP that will be fully within i_size. */ >> mask |= shmem_get_orders_within_size(inode, within_size_orders, index, 0); >> @@ -1878,6 +1881,7 @@ unsigned long shmem_allowable_huge_orders(struct inode *inode, >> if (global_orders > 0) >> mask |= READ_ONCE(huge_shmem_orders_inherit); >> >> + mask &= ~disabled_orders; >> return THP_ORDERS_ALL_FILE_DEFAULT & mask; >> } >> >> @@ -5461,7 +5465,7 @@ void __init shmem_init(void) >> * Default to setting PMD-sized THP to inherit the global setting and >> * disable all other multi-size THPs. >> */ >> - if (!shmem_orders_configured) >> + if (!shmem_orders_configured && pgtable_has_pmd_leaves()) >> huge_shmem_orders_inherit = BIT(HPAGE_PMD_ORDER); >> #endif >> return; >> -- >> 2.54.0 >> >> >