From mboxrd@z Thu Jan 1 00:00:00 1970 Received: from us-smtp-delivery-124.mimecast.com (us-smtp-delivery-124.mimecast.com [170.10.133.124]) (using TLSv1.2 with cipher ECDHE-RSA-AES256-GCM-SHA384 (256/256 bits)) (No client certificate requested) by smtp.subspace.kernel.org (Postfix) with ESMTPS id 76A622EAD1B for ; Wed, 18 Mar 2026 17:22:17 +0000 (UTC) Authentication-Results: smtp.subspace.kernel.org; arc=none smtp.client-ip=170.10.133.124 ARC-Seal:i=1; a=rsa-sha256; d=subspace.kernel.org; s=arc-20240116; t=1773854539; cv=none; b=FTI0/EbQ1SSyvfMW5LrxhV0FptChYzV3OurUIsYpvTbxVYhU60PUtvA+NHa0BqYDI3usC5M/9Kgv6cDFec/m2tafkV7At9wMmqyPng3/mLQBvYGSQPcGd8Tf+Pakq1MhodGYBSUwfz8ed4rTyNsp7NRLIWnOLlV/jklTbdM12Cg= ARC-Message-Signature:i=1; a=rsa-sha256; d=subspace.kernel.org; s=arc-20240116; t=1773854539; c=relaxed/simple; bh=LbvsWPnmsc+prZF/hYnL4xG/ZIMyzFawQtpasZ6wKI8=; h=Message-ID:Date:MIME-Version:Subject:To:Cc:References:From: In-Reply-To:Content-Type; b=WNiLP+BdIutwPF/Os2ooTBVu4F6RzSs9T78LTGlEzVsiv2bt34LaynJ/hscSSx/cuLeUZZHxHwUbxMOwX2dBA2cgAMIfPk3QDpDwZAUSrrHlTKM33t1K8mEOQClTZvlGkWUcBnepPYQtNNVMniT9ZHPuWoEZ04S1CBUjiytWgjo= ARC-Authentication-Results:i=1; smtp.subspace.kernel.org; dmarc=pass (p=quarantine dis=none) header.from=redhat.com; spf=pass smtp.mailfrom=redhat.com; dkim=pass (1024-bit key) header.d=redhat.com header.i=@redhat.com header.b=AF6ZaBvK; dkim=pass (2048-bit key) header.d=redhat.com header.i=@redhat.com header.b=N+8aBV9r; arc=none smtp.client-ip=170.10.133.124 Authentication-Results: smtp.subspace.kernel.org; dmarc=pass (p=quarantine dis=none) header.from=redhat.com Authentication-Results: smtp.subspace.kernel.org; spf=pass smtp.mailfrom=redhat.com Authentication-Results: smtp.subspace.kernel.org; dkim=pass (1024-bit key) header.d=redhat.com header.i=@redhat.com header.b="AF6ZaBvK"; dkim=pass (2048-bit key) header.d=redhat.com header.i=@redhat.com header.b="N+8aBV9r" DKIM-Signature: v=1; a=rsa-sha256; c=relaxed/relaxed; d=redhat.com; s=mimecast20190719; t=1773854536; h=from:from:reply-to:subject:subject:date:date:message-id:message-id: to:to:cc:cc:mime-version:mime-version:content-type:content-type: content-transfer-encoding:content-transfer-encoding: in-reply-to:in-reply-to:references:references; bh=W45kMnLtC5MOWuTuvK3U+l7AgaOFnu4Qio9p76W/VgI=; b=AF6ZaBvKNpfqSbOFuGyh+CoE5KhPcEDV/bEzPEuHjkDgbDdQvAwH6m8NI1uumsW5QIse5g gqSasqYrQens/eQlnx131O4ZnYPscdjFDZkT5vKH3cVfGYUgpYnB8yU0VxbsITC/bIYSyz 3E0hJCNUpOsUrRwTGF3mAnyf0mR9xPw= Received: from mail-qk1-f198.google.com (mail-qk1-f198.google.com [209.85.222.198]) by relay.mimecast.com with ESMTP with STARTTLS (version=TLSv1.3, cipher=TLS_AES_256_GCM_SHA384) id us-mta-446-cNisWhOGMgGGYUST9z0xnA-1; Wed, 18 Mar 2026 13:22:15 -0400 X-MC-Unique: cNisWhOGMgGGYUST9z0xnA-1 X-Mimecast-MFC-AGG-ID: cNisWhOGMgGGYUST9z0xnA_1773854535 Received: by mail-qk1-f198.google.com with SMTP id af79cd13be357-8cdb995a1bfso144361085a.1 for ; Wed, 18 Mar 2026 10:22:15 -0700 (PDT) DKIM-Signature: v=1; a=rsa-sha256; c=relaxed/relaxed; d=redhat.com; s=google; t=1773854535; x=1774459335; darn=vger.kernel.org; h=content-transfer-encoding:in-reply-to:content-language:from :references:cc:to:subject:user-agent:mime-version:date:message-id :from:to:cc:subject:date:message-id:reply-to; bh=W45kMnLtC5MOWuTuvK3U+l7AgaOFnu4Qio9p76W/VgI=; b=N+8aBV9rVFEhc9pRMgPG2uwxwWHPGb+PGlXqlPUphhN8fKw1j/75ZwAj0fNfDGExcv /fK3sIAQdB29Glak0qtI/5UNzqzdF8myQIMbL0RRhxcWE95UnbmfhhMrr/BFB9Dof9DP BJVXajs6sMm3v2bcBzoaGIh5XTCN3WGM8I11eHWeAl+K8TC8tFwpAaIoOtSSl6qHaACQ QRmNUM36P3lFixnBHoxHZJIKX7905BHMe9yW955XlWgMs3BHvGIbJdPZlcR4QuhSUeUh yhh5/7gDIYDxu+Mm+cbnd/d9HYMIxJRgTPe5f+dDZYOiyl9wxLQQ75TzaxGH1fMZdFBy sAEg== X-Google-DKIM-Signature: v=1; a=rsa-sha256; c=relaxed/relaxed; d=1e100.net; s=20251104; t=1773854535; x=1774459335; h=content-transfer-encoding:in-reply-to:content-language:from :references:cc:to:subject:user-agent:mime-version:date:message-id :x-gm-gg:x-gm-message-state:from:to:cc:subject:date:message-id :reply-to; bh=W45kMnLtC5MOWuTuvK3U+l7AgaOFnu4Qio9p76W/VgI=; b=WmZx4XO3pVCtZA9f5Q7BFnqQkBZxsBs5EH6kNNLtAT3WM0b88GjxetTFzuFNJUUGYy Ke879hYifRwWmDHSNuT0uaQ3Pf6qmUdxL8CdFNLsw1ZpeQ/Va7kbKT3QZ6E/d8cUH8nK TFzJLRADC66FqeW5aB/iKu3IcCrzPVUzabYkYhplihxaMNmYVgHHodrP+KWIk4JZbbQk 2qz1MGVEL3vIHVod8nQkuDqeR17zNuOzXxdYS6+EIY/1v6o7Jgds+dwI9c/xAK93lrRn /HTHbDVqgG7rY2zOdV3yjR5LL+0P54k+qA+biroUeE5E38eEPMyonAm22YoYyb4NZX+U AknA== X-Gm-Message-State: AOJu0YyzZOMP4g66YzF1kiXehfxZL9jN5QF6Yy1m1afY21Sizmp0NwvV UHuW0fIpseFJk6j3U0lsju+krDqjHU8Lz7SMeCezTFD3rXGYLPr5bS/utkC4HHxApKmg+pyBU7y tGpGK9mSsTORBQBT5OmEVGBcSmq+NdnI53xZkzZGzpB3aN4p9v1IuuZiGT3WEcVLfEWzJ8bl3Ve hG X-Gm-Gg: ATEYQzwqn0lHd6jBBoVTwwwd4fqefzxiXqhduRyLkm2UoZL330fOWBf/1OTzEFnDYWz zEvktC6SbkU07ynpoxwSN3+0pLAx6VN5H1C62nW14iquXIZMiqjg/Xl6VISj1LcyP+OD9wvyKzK E75F6FHfe9DRkfYYFIbSblXlgAYGdghk0e+Eh/Q1y64E3L54urE1hqUlfS/0R95psx6Smj+qdIZ 8lZkJyMacZasuiBgUjfnZfebFcUafDNdOEaDDeqGtwM9NE8ATvDzZYjJZ4nfYiEhLWnfpYQuGnP kef6pTasKkZR6+2BuCU2VsQdJw+IRQN1ZYpffw+Sx8/z5yNr+LJBXO74QxBreSER2YyJ60M/kN6 Yb5be6UWqHIgJbOXcTXT6Iq/l7USXuB53+6gM+Gr2eFm1+koaVa/YAXwPCEjT X-Received: by 2002:a05:620a:28c7:b0:8ca:363a:cd73 with SMTP id af79cd13be357-8cfad3b7093mr530911085a.68.1773854534184; Wed, 18 Mar 2026 10:22:14 -0700 (PDT) X-Received: by 2002:a05:620a:28c7:b0:8ca:363a:cd73 with SMTP id af79cd13be357-8cfad3b7093mr530900885a.68.1773854533464; Wed, 18 Mar 2026 10:22:13 -0700 (PDT) Received: from [192.168.10.111] (c-76-154-99-94.hsd1.co.comcast.net. [76.154.99.94]) by smtp.gmail.com with ESMTPSA id af79cd13be357-8cfacdaeb88sm300378585a.5.2026.03.18.10.22.08 (version=TLS1_3 cipher=TLS_AES_128_GCM_SHA256 bits=128/128); Wed, 18 Mar 2026 10:22:12 -0700 (PDT) Message-ID: <9d9815ed-561b-4071-836f-4f2409830761@redhat.com> Date: Wed, 18 Mar 2026 11:22:07 -0600 Precedence: bulk X-Mailing-List: linux-kernel@vger.kernel.org List-Id: List-Subscribe: List-Unsubscribe: MIME-Version: 1.0 User-Agent: Mozilla Thunderbird Subject: Re: [PATCH mm-unstable v3 5/5] mm/khugepaged: unify khugepaged and madv_collapse with collapse_single_pmd() To: "Lorenzo Stoakes (Oracle)" Cc: linux-kernel@vger.kernel.org, linux-mm@kvack.org, aarcange@redhat.com, akpm@linux-foundation.org, anshuman.khandual@arm.com, apopple@nvidia.com, baohua@kernel.org, baolin.wang@linux.alibaba.com, byungchul@sk.com, catalin.marinas@arm.com, cl@gentwo.org, corbet@lwn.net, dave.hansen@linux.intel.com, david@kernel.org, dev.jain@arm.com, gourry@gourry.net, hannes@cmpxchg.org, hughd@google.com, jackmanb@google.com, jack@suse.cz, jannh@google.com, jglisse@google.com, joshua.hahnjy@gmail.com, kas@kernel.org, lance.yang@linux.dev, Liam.Howlett@oracle.com, lorenzo.stoakes@oracle.com, mathieu.desnoyers@efficios.com, matthew.brost@intel.com, mhiramat@kernel.org, mhocko@suse.com, peterx@redhat.com, pfalcato@suse.de, rakie.kim@sk.com, raquini@redhat.com, rdunlap@infradead.org, richard.weiyang@gmail.com, rientjes@google.com, rostedt@goodmis.org, rppt@kernel.org, ryan.roberts@arm.com, shivankg@amd.com, sunnanyong@huawei.com, surenb@google.com, thomas.hellstrom@linux.intel.com, tiwai@suse.de, usamaarif642@gmail.com, vbabka@suse.cz, vishal.moola@gmail.com, wangkefeng.wang@huawei.com, will@kernel.org, willy@infradead.org, yang@os.amperecomputing.com, ying.huang@linux.alibaba.com, ziy@nvidia.com, zokeefe@google.com References: <20260311211315.450947-1-npache@redhat.com> <20260311211315.450947-6-npache@redhat.com> From: Nico Pache Content-Language: en-US, en-ZM In-Reply-To: Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 7bit On 3/16/26 12:54 PM, Lorenzo Stoakes (Oracle) wrote: > On Wed, Mar 11, 2026 at 03:13:15PM -0600, Nico Pache wrote: >> The khugepaged daemon and madvise_collapse have two different >> implementations that do almost the same thing. Create collapse_single_pmd >> to increase code reuse and create an entry point to these two users. > > Ah this is nice :) Thanks! Thanks :) hopefully more khugepaged cleanups to come after these series' land. > >> >> Refactor madvise_collapse and collapse_scan_mm_slot to use the new >> collapse_single_pmd function. This introduces a minor behavioral change >> that is most likely an undiscovered bug. The current implementation of >> khugepaged tests collapse_test_exit_or_disable before calling >> collapse_pte_mapped_thp, but we weren't doing it in the madvise_collapse >> case. By unifying these two callers madvise_collapse now also performs >> this check. We also modify the return value to be SCAN_ANY_PROCESS which >> properly indicates that this process is no longer valid to operate on. >> >> By moving the madvise_collapse writeback-retry logic into the helper >> function we can also avoid having to revalidate the VMA. >> >> We also guard the khugepaged_pages_collapsed variable to ensure its only >> incremented for khugepaged. >> >> Signed-off-by: Nico Pache > > The logic all seems correct to me, just a bunch of nits below really. This is > a really nice refactoring! :) > > With them addressed: > > Reviewed-by: Lorenzo Stoakes (Oracle) Thanks I will address those! > > Cheers, Lorenzo > >> --- >> mm/khugepaged.c | 120 +++++++++++++++++++++++++----------------------- >> 1 file changed, 63 insertions(+), 57 deletions(-) >> >> diff --git a/mm/khugepaged.c b/mm/khugepaged.c >> index 33ae56e313ed..733c4a42c2ce 100644 >> --- a/mm/khugepaged.c >> +++ b/mm/khugepaged.c >> @@ -2409,6 +2409,65 @@ static enum scan_result collapse_scan_file(struct mm_struct *mm, >> return result; >> } >> >> +/* >> + * Try to collapse a single PMD starting at a PMD aligned addr, and return >> + * the results. >> + */ >> +static enum scan_result collapse_single_pmd(unsigned long addr, >> + struct vm_area_struct *vma, bool *mmap_locked, > > mmap_locked seems mildly pointless here, and it's a semi-code smell to pass 'is > locked' flags I think. > > You never read this, but the parameter implies somebody might pass in mmaplocked > == false, but you know it's always true here. > > Anyway I think it makes more sense to pass in lock_dropped and get rid of > mmap_locked in madvise_collapse() and just pass in lock_dropped directly > (setting it false if anon). > > Also obviously update collapse_scan_mm_slot() to use lock_dropped instead just > inverted. > > That's clearer I think since it makes it a verb rather than a noun and the > function is dictating whether or not the lock is dropped, it also implies the > lock is held on entry. Ok I will give this a shot! > >> + struct collapse_control *cc) >> +{ >> + struct mm_struct *mm = vma->vm_mm; >> + bool triggered_wb = false; >> + enum scan_result result; >> + struct file *file; >> + pgoff_t pgoff; >> + > > Maybe move the mmap_assert_locked() from madvise_collapse() to here? Then we > assert it in both cases. ack, Sounds like a good idea! > >> + if (vma_is_anonymous(vma)) { >> + result = collapse_scan_pmd(mm, vma, addr, mmap_locked, cc); >> + goto end; >> + } >> + >> + file = get_file(vma->vm_file); >> + pgoff = linear_page_index(vma, addr); >> + >> + mmap_read_unlock(mm); >> + *mmap_locked = false; >> +retry: >> + result = collapse_scan_file(mm, addr, file, pgoff, cc); >> + >> + /* >> + * For MADV_COLLAPSE, when encountering dirty pages, try to writeback, >> + * then retry the collapse one time. >> + */ >> + if (!cc->is_khugepaged && result == SCAN_PAGE_DIRTY_OR_WRITEBACK && >> + !triggered_wb && mapping_can_writeback(file->f_mapping)) { >> + const loff_t lstart = (loff_t)pgoff << PAGE_SHIFT; >> + const loff_t lend = lstart + HPAGE_PMD_SIZE - 1; >> + >> + filemap_write_and_wait_range(file->f_mapping, lstart, lend); >> + triggered_wb = true; >> + goto retry; > > Thinking through this logic I do agree that we don't need to revalidate here, > which should be quite a nice win, I just don't know why we previously assumed > we'd have to... or maybe it was just because it became too spaghetti to goto > around it somehow?? I believe the latter, the retry went at the top of the loop, and the revalidation was already being done. > >> + } >> + fput(file); >> + >> + if (result == SCAN_PTE_MAPPED_HUGEPAGE) { >> + mmap_read_lock(mm); >> + if (collapse_test_exit_or_disable(mm)) >> + result = SCAN_ANY_PROCESS; >> + else >> + result = try_collapse_pte_mapped_thp(mm, addr, >> + !cc->is_khugepaged); >> + if (result == SCAN_PMD_MAPPED) >> + result = SCAN_SUCCEED; >> + mmap_read_unlock(mm); >> + } >> +end: >> + if (cc->is_khugepaged && result == SCAN_SUCCEED) >> + ++khugepaged_pages_collapsed; >> + return result; >> +} >> + >> static void collapse_scan_mm_slot(unsigned int progress_max, >> enum scan_result *result, struct collapse_control *cc) >> __releases(&khugepaged_mm_lock) >> @@ -2479,34 +2538,9 @@ static void collapse_scan_mm_slot(unsigned int progress_max, >> VM_BUG_ON(khugepaged_scan.address < hstart || >> khugepaged_scan.address + HPAGE_PMD_SIZE > >> hend); > > Nice-to-have, but could we convert these VM_BUG_ON()'s to VM_WARN_ON_ONCE()'s > while we're passing? Yeah sure, I have a question about these, because they do concern me (perhaps out of ignorance). does a WARN_ON_ONCE stop the daemon? I would be concerned about a rogue khugepaged instance going through and messing with page tables when it fails some assertion. Could this not lead to serious memory/file corruptions? Thanks for the reviews! Cheers, -- Nico > >> - if (!vma_is_anonymous(vma)) { >> - struct file *file = get_file(vma->vm_file); >> - pgoff_t pgoff = linear_page_index(vma, >> - khugepaged_scan.address); >> - >> - mmap_read_unlock(mm); >> - mmap_locked = false; >> - *result = collapse_scan_file(mm, >> - khugepaged_scan.address, file, pgoff, cc); >> - fput(file); >> - if (*result == SCAN_PTE_MAPPED_HUGEPAGE) { >> - mmap_read_lock(mm); >> - if (collapse_test_exit_or_disable(mm)) >> - goto breakouterloop; >> - *result = try_collapse_pte_mapped_thp(mm, >> - khugepaged_scan.address, false); >> - if (*result == SCAN_PMD_MAPPED) >> - *result = SCAN_SUCCEED; >> - mmap_read_unlock(mm); >> - } >> - } else { >> - *result = collapse_scan_pmd(mm, vma, >> - khugepaged_scan.address, &mmap_locked, cc); >> - } >> - >> - if (*result == SCAN_SUCCEED) >> - ++khugepaged_pages_collapsed; >> >> + *result = collapse_single_pmd(khugepaged_scan.address, >> + vma, &mmap_locked, cc); >> /* move to next address */ >> khugepaged_scan.address += HPAGE_PMD_SIZE; >> if (!mmap_locked) >> @@ -2806,9 +2840,7 @@ int madvise_collapse(struct vm_area_struct *vma, unsigned long start, >> >> for (addr = hstart; addr < hend; addr += HPAGE_PMD_SIZE) { >> enum scan_result result = SCAN_FAIL; >> - bool triggered_wb = false; >> >> -retry: >> if (!mmap_locked) { >> cond_resched(); >> mmap_read_lock(mm); >> @@ -2823,46 +2855,20 @@ int madvise_collapse(struct vm_area_struct *vma, unsigned long start, >> hend = min(hend, vma->vm_end & HPAGE_PMD_MASK); >> } >> mmap_assert_locked(mm); >> - if (!vma_is_anonymous(vma)) { >> - struct file *file = get_file(vma->vm_file); >> - pgoff_t pgoff = linear_page_index(vma, addr); >> >> - mmap_read_unlock(mm); >> - mmap_locked = false; >> - *lock_dropped = true; >> - result = collapse_scan_file(mm, addr, file, pgoff, cc); >> - >> - if (result == SCAN_PAGE_DIRTY_OR_WRITEBACK && !triggered_wb && >> - mapping_can_writeback(file->f_mapping)) { >> - loff_t lstart = (loff_t)pgoff << PAGE_SHIFT; >> - loff_t lend = lstart + HPAGE_PMD_SIZE - 1; >> + result = collapse_single_pmd(addr, vma, &mmap_locked, cc); >> >> - filemap_write_and_wait_range(file->f_mapping, lstart, lend); >> - triggered_wb = true; >> - fput(file); >> - goto retry; >> - } >> - fput(file); >> - } else { >> - result = collapse_scan_pmd(mm, vma, addr, &mmap_locked, cc); >> - } >> if (!mmap_locked) >> *lock_dropped = true; >> >> -handle_result: >> switch (result) { >> case SCAN_SUCCEED: >> case SCAN_PMD_MAPPED: >> ++thps; >> break; >> - case SCAN_PTE_MAPPED_HUGEPAGE: >> - BUG_ON(mmap_locked); >> - mmap_read_lock(mm); >> - result = try_collapse_pte_mapped_thp(mm, addr, true); >> - mmap_read_unlock(mm); >> - goto handle_result; >> /* Whitelisted set of results where continuing OK */ >> case SCAN_NO_PTE_TABLE: >> + case SCAN_PTE_MAPPED_HUGEPAGE: >> case SCAN_PTE_NON_PRESENT: >> case SCAN_PTE_UFFD_WP: >> case SCAN_LACK_REFERENCED_PAGE: >> -- >> 2.53.0 >> >