]> www.infradead.org Git - users/hch/block.git/commitdiff
nsfs: add pid translation ioctls
authorChristian Brauner <brauner@kernel.org>
Sun, 7 Jun 2020 20:47:08 +0000 (22:47 +0200)
committerChristian Brauner <brauner@kernel.org>
Tue, 25 Jun 2024 21:00:41 +0000 (23:00 +0200)
Add ioctl()s to translate pids between pid namespaces.

LXCFS is a tiny fuse filesystem used to virtualize various aspects of
procfs. LXCFS is run on the host. The files and directories it creates
can be bind-mounted by e.g. a container at startup and mounted over the
various procfs files the container wishes to have virtualized. When e.g.
a read request for uptime is received, LXCFS will receive the pid of the
reader. In order to virtualize the corresponding read, LXCFS needs to
know the pid of the init process of the reader's pid namespace. In order
to do this, LXCFS first needs to fork() two helper processes. The first
helper process setns() to the readers pid namespace. The second helper
process is needed to create a process that is a proper member of the pid
namespace. The second helper process then creates a ucred message with
ucred.pid set to 1 and sends it back to LXCFS. The kernel will translate
the ucred.pid field to the corresponding pid number in LXCFS's pid
namespace. This way LXCFS can learn the init pid number of the reader's
pid namespace and can go on to virtualize. Since these two forks() are
costly LXCFS maintains an init pid cache that caches a given pid for a
fixed amount of time. The cache is pruned during new read requests.
However, even with the cache the hit of the two forks() is singificant
when a very large number of containers are running. With this simple
patch we add an ns ioctl that let's a caller retrieve the init pid nr of
a pid namespace through its pid namespace fd. This significantly
improves performance with a very simple change.

Support translation of pids and tgids. Other concepts can be added but
there are no obvious users for this right now.

To protect against races pidfds can be used to check whether the process
is still valid. If needed, this can also be extended to work on pidfds
directly.

Link: https://lore.kernel.org/r/20240619-work-ns_ioctl-v1-1-7c0097e6bb6b@kernel.org
Reviewed-by: Alexander Mikhalitsyn <aleksandr.mikhalitsyn@canonical.com>
Signed-off-by: Christian Brauner <brauner@kernel.org>
fs/nsfs.c
include/uapi/linux/nsfs.h

index 07e22a15ef02bb606e355765de0ff024131b2ef5..a23c827a0299605814c86a3c61ac26cf340db2ce 100644 (file)
--- a/fs/nsfs.c
+++ b/fs/nsfs.c
@@ -8,6 +8,7 @@
 #include <linux/magic.h>
 #include <linux/ktime.h>
 #include <linux/seq_file.h>
+#include <linux/pid_namespace.h>
 #include <linux/user_namespace.h>
 #include <linux/nsfs.h>
 #include <linux/uaccess.h>
@@ -123,9 +124,12 @@ static long ns_ioctl(struct file *filp, unsigned int ioctl,
                        unsigned long arg)
 {
        struct user_namespace *user_ns;
+       struct pid_namespace *pid_ns;
+       struct task_struct *tsk;
        struct ns_common *ns = get_proc_ns(file_inode(filp));
        uid_t __user *argp;
        uid_t uid;
+       int ret;
 
        switch (ioctl) {
        case NS_GET_USERNS:
@@ -143,9 +147,56 @@ static long ns_ioctl(struct file *filp, unsigned int ioctl,
                argp = (uid_t __user *) arg;
                uid = from_kuid_munged(current_user_ns(), user_ns->owner);
                return put_user(uid, argp);
+       case NS_GET_PID_FROM_PIDNS:
+               fallthrough;
+       case NS_GET_TGID_FROM_PIDNS:
+               fallthrough;
+       case NS_GET_PID_IN_PIDNS:
+               fallthrough;
+       case NS_GET_TGID_IN_PIDNS:
+               if (ns->ops->type != CLONE_NEWPID)
+                       return -EINVAL;
+
+               ret = -ESRCH;
+               pid_ns = container_of(ns, struct pid_namespace, ns);
+
+               rcu_read_lock();
+
+               if (ioctl == NS_GET_PID_IN_PIDNS ||
+                   ioctl == NS_GET_TGID_IN_PIDNS)
+                       tsk = find_task_by_vpid(arg);
+               else
+                       tsk = find_task_by_pid_ns(arg, pid_ns);
+               if (!tsk)
+                       break;
+
+               switch (ioctl) {
+               case NS_GET_PID_FROM_PIDNS:
+                       ret = task_pid_vnr(tsk);
+                       break;
+               case NS_GET_TGID_FROM_PIDNS:
+                       ret = task_tgid_vnr(tsk);
+                       break;
+               case NS_GET_PID_IN_PIDNS:
+                       ret = task_pid_nr_ns(tsk, pid_ns);
+                       break;
+               case NS_GET_TGID_IN_PIDNS:
+                       ret = task_tgid_nr_ns(tsk, pid_ns);
+                       break;
+               default:
+                       ret = 0;
+                       break;
+               }
+               rcu_read_unlock();
+
+               if (!ret)
+                       ret = -ESRCH;
+               break;
        default:
-               return -ENOTTY;
+               ret = -ENOTTY;
        }
+
+       return ret;
 }
 
 int ns_get_name(char *buf, size_t size, struct task_struct *task,
index a0c8552b64ee04375cf9409b3a48f1b5230bc11e..faeb9195da08c49845d5d9097d1736f99efa1eb7 100644 (file)
 #define NS_GET_NSTYPE          _IO(NSIO, 0x3)
 /* Get owner UID (in the caller's user namespace) for a user namespace */
 #define NS_GET_OWNER_UID       _IO(NSIO, 0x4)
+/* Translate pid from target pid namespace into the caller's pid namespace. */
+#define NS_GET_PID_FROM_PIDNS  _IOR(NSIO, 0x5, int)
+/* Return thread-group leader id of pid in the callers pid namespace. */
+#define NS_GET_TGID_FROM_PIDNS _IOR(NSIO, 0x7, int)
+/* Translate pid from caller's pid namespace into a target pid namespace. */
+#define NS_GET_PID_IN_PIDNS    _IOR(NSIO, 0x6, int)
+/* Return thread-group leader id of pid in the target pid namespace. */
+#define NS_GET_TGID_IN_PIDNS   _IOR(NSIO, 0x8, int)
 
 #endif /* __LINUX_NSFS_H */