zoukankan      html  css  js  c++  java
  • epoll函数

    http://www.cnblogs.com/ljygoodgoodstudydaydayup/p/3916760.html

    epoll的相关系统调用:

    epoll只有epoll_create,epoll_ctl,epoll_wait 3个系统调用

    1. int epoll_create(int size);

    创建一个epoll的句柄。自从linux2.6.8之后,size参数是被忽略的。需要注意的是,当创建好epoll句柄后,它就是会占用一个fd值,在linux下如果查看/proc/进程id/fd/,是能够看到这个fd的,所以在使用完epoll后,必须调用close()关闭,否则可能导致fd被耗尽。

    2. int epoll_ctl(int epfd, int op, int fd, struct epoll_event *event);

    epoll的事件注册函数,它不同于select()是在监听事件时告诉内核要监听什么类型的事件,而是在这里先注册要监听的事件类型。

    第一个参数是epoll_create()的返回值。

    第二个参数表示动作,用三个宏来表示:

    EPOLL_CTL_ADD:注册新的fd到epfd中;

    EPOLL_CTL_MOD:修改已经注册的fd的监听事件;

    EPOLL_CTL_DEL:从epfd中删除一个fd;

    第三个参数是需要监听的fd。

    第四个参数是告诉内核需要监听什么事,event.data.fd就是第三个参数fd,event.events是该fd上需要监听的事件类型,struct epoll_event结构如下:

    //保存触发事件的某个文件描述符相关的数据(与具体使用方式有关)
    
    typedef union epoll_data {
        void *ptr;
        int fd;//需要监听的文件描述符
        __uint32_t u32;
        __uint64_t u64;
    } epoll_data_t;
     //感兴趣的事件和被触发的事件
    struct epoll_event {
        __uint32_t events; /* Epoll events *///需要监听的文件描述符的事件类型
        epoll_data_t data; /* User data variable */
    };

    events可以是以下几个宏的集合:

    EPOLLIN :表示对应的文件描述符可以读(包括对端SOCKET正常关闭);

    EPOLLOUT:表示对应的文件描述符可以写;

    EPOLLPRI:表示对应的文件描述符有紧急的数据可读(这里应该表示有带外数据到来);

    EPOLLERR:表示对应的文件描述符发生错误;

    EPOLLHUP:表示对应的文件描述符被挂断;

    EPOLLET: 将EPOLL设为边缘触发(Edge Triggered)模式,这是相对于水平触发(Level Triggered)来说的。

    EPOLLONESHOT:只监听一次事件,当监听完这次事件之后,如果还需要继续监听这个socket的话,需要再次把这个socket加入到EPOLL队列里

    3. int epoll_wait(int epfd, struct epoll_event * events, int maxevents, int timeout);

    收集在epoll监控的事件中已经发生的事件。参数events是分配好的epoll_event结构体数组,epoll将会把发生的事件赋值到events数组中(events不可以是空指针,内核只负责把数据复制到这个events数组中,不会去帮助我们在用户态中分配内存)maxevents告之内核这个events有多大,这个 maxevents的值不能大于创建epoll_create()时的size,参数timeout是超时时间(毫秒,0会立即返回,-1将不确定,也有说法说是永久阻塞)。如果函数调用成功,返回对应I/O上已准备好的文件描述符数目,如返回0表示已超时。

    epoll工作原理:

    epoll同样只告知那些就绪的文件描述符,而且当我们调用epoll_wait()获得就绪文件描述符时,返回的不是实际的描述符,而是一个代表就绪描述符数量的值,你只需要去epoll指定的一个数组中依次取得相应数量的文件描述符即可,这里也使用了内存映射(mmap)技术,这样便彻底省掉了这些文件描述符在系统调用时复制的开销。(我的理解:内核调用epoll_wait时,把就绪的fd及事件赋值到events数组中,用户在用户态中可以直接使用events数组,所以这其中用到mmap技术)

    另一个本质的改进在于epoll采用基于事件的就绪通知方式。在select/poll中,进程只有在调用一定的方法后,内核才对所有监视的文件描述符进行扫描,而epoll事先通过epoll_ctl()来注册一个文件描述符,一旦基于某个文件描述符就绪时,内核会采用类似callback的回调机制,迅速激活这个文件描述符,当进程调用epoll_wait()时便得到通知。

    Epoll的2种工作方式-水平触发(LT)和边缘触发(ET)

    假如有这样一个例子:

    1. 我们已经把一个用来从管道中读取数据的文件句柄(RFD)添加到epoll描述符

    2. 这个时候从管道的另一端被写入了2KB的数据

    3. 调用epoll_wait(2),并且它会返回RFD,说明它已经准备好读取操作

    4. 然后我们读取了1KB的数据

    5. 调用epoll_wait(2)......

    Edge Triggered 工作模式:

    如果我们在第1步将RFD添加到epoll描述符的时候使用了EPOLLET标志,那么在第5步调用epoll_wait(2)之后将有可能会挂起,因为剩余的数据还存在于文件的输入缓冲区内,而且数据发出端还在等待一个针对已经发出数据的反馈信息。只有在监视的文件句柄上发生了某个事件的时候 ET 工作模式才会汇报事件。因此在第5步的时候,调用者可能会放弃等待仍在存在于文件输入缓冲区内的剩余数据。在上面的例子中,会有一个事件产生在RFD句柄上,因为在第2步执行了一个写操作,然后,事件将会在第3步被销毁。因为第4步的读取操作没有读空文件输入缓冲区内的数据,因此我们在第5步调用 epoll_wait(2)完成后,是否挂起是不确定的。epoll工作在ET模式的时候,必须使用非阻塞套接口,以避免由于一个文件句柄的阻塞读/阻塞写操作把处理多个文件描述符的任务饿死。最好以下面的方式调用ET模式的epoll接口,在后面会介绍避免可能的缺陷。

       i    基于非阻塞文件句柄

       ii   只有当read(2)或者write(2)返回EAGAIN时才需要挂起,等待。但这并不是说每次read()时都需要循环读,直到读到产生一个EAGAIN才认为此次事件处理完成,当read()返回的读到的数据长度小于请求的数据长度时,就可以确定此时缓冲中已没有数据了,也就可以认为此事读事件已处理完成。

    LT(level triggered)是epoll缺省的工作方式,并且同时支持block和no-block socket.在这种做法中,内核告诉你一个文件描述符是否就绪了,然后你可以对这个就绪的fd进行IO操作。如果你不作任何操作,内核还是会继续通知你 的,所以,这种模式编程出错误可能性要小一点。传统的select/poll都是这种模型的代表.

    ET (edge-triggered)是高速工作方式,只支持no-block socket,它效率要比LT更高。ET与LT的区别在于,当一个新的事件到来时,ET模式下当然可以从epoll_wait调用中获取到这个事件,可是如果这次没有把这个事件对应的套接字缓冲区处理完,在这个套接字中没有新的事件再次到来时,在ET模式下是无法再次从epoll_wait调用中获取这个事件的。而LT模式正好相反,只要一个事件对应的套接字缓冲区还有数据,就总能从epoll_wait中获取这个事件。

    linux下epoll如何实现高效处理百万句柄的

    开发高性能网络程序时,windows开发者们言必称iocp,linux开发者们则言必称epoll。大家都明白epoll是一种IO多路复用技术,可以非常高效的处理数以百万计的socket句柄,比起以前的select和poll效率高大发了。我们用起epoll来都感觉挺爽,确实快,那么,它到底为什么可以高速处理这么多并发连接呢?

    使用起来很清晰,首先要调用epoll_create建立一个epoll对象。参数size是内核保证能够正确处理的最大句柄数,多于这个最大数时内核可不保证效果。

    epoll_ctl可以操作上面建立的epoll,例如,将刚建立的socket加入到epoll中让其监控,或者把 epoll正在监控的某个socket句柄移出epoll,不再监控它等等。

    epoll_wait在调用时,在给定的timeout时间内,当在监控的所有句柄中有事件发生时,就返回用户态的进程。

    从上面的调用方式就可以看到epoll比select/poll的优越之处:因为后者每次调用时都要传递你所要监控的所有socket给select/poll系统调用,这意味着需要将用户态的socket列表copy到内核态,如果以万计的句柄会导致每次都要copy几十几百KB的内存到内核态,非常低效。而我们调用epoll_wait时就相当于以往调用select/poll,但是这时却不用传递socket句柄给内核,因为内核已经在epoll_ctl中拿到了要监控的句柄列表。

    当我们执行epoll_ctl时,除了把socket放到epoll文件系统里file对象对应的红黑树上之外,还会给内核中断处理程序注册一个回调函数,告诉内核,如果这个句柄(socket)的中断到了,就把它放到准备就绪list链表里。所以,当一个socket上有数据到了,内核在把网卡上的数据copy到内核中后就来把socket插入到准备就绪链表里了。

     #include <stdio.h>
    #include <stdlib.h>
    #include <unistd.h>
    #include <errno.h>
    #include <sys/socket.h>
    #include <netdb.h>
    #include <fcntl.h>
    #include <sys/epoll.h>
    #include <string.h>
    
    #define MAXEVENTS 64
    
    //函数:
    //功能:创建和绑定一个TCP socket
    //参数:端口
    //返回值:创建的socket
    static int
    create_and_bind (char *port)
    {
      struct addrinfo hints;
      struct addrinfo *result, *rp;
      int s, sfd;
    
      memset (&hints, 0, sizeof (struct addrinfo));
      hints.ai_family = AF_UNSPEC;     /* Return IPv4 and IPv6 choices */
      hints.ai_socktype = SOCK_STREAM; /* We want a TCP socket */
      hints.ai_flags = AI_PASSIVE;     /* All interfaces */
    
      s = getaddrinfo (NULL, port, &hints, &result);
      if (s != 0)
        {
          fprintf (stderr, "getaddrinfo: %s
    ", gai_strerror (s));
          return -1;
        }
    
      for (rp = result; rp != NULL; rp = rp->ai_next)
        {
          sfd = socket (rp->ai_family, rp->ai_socktype, rp->ai_protocol);
          if (sfd == -1)
            continue;
    
          s = bind (sfd, rp->ai_addr, rp->ai_addrlen);
          if (s == 0)
            {
              /* We managed to bind successfully! */
              break;
            }
    
          close (sfd);
        }
    
      if (rp == NULL)
        {
          fprintf (stderr, "Could not bind
    ");
          return -1;
        }
    
      freeaddrinfo (result);
    
      return sfd;
    }
    
    
    //函数
    //功能:设置socket为非阻塞的,因为epoll设为边缘触发模式
    static int
    make_socket_non_blocking (int sfd)
    {
      int flags, s;
    
      //得到文件状态标志
      flags = fcntl (sfd, F_GETFL, 0);
      if (flags == -1)
        {
          perror ("fcntl");
          return -1;
        }
    
      //设置文件状态标志
      flags |= O_NONBLOCK;
      s = fcntl (sfd, F_SETFL, flags);
      if (s == -1)
        {
          perror ("fcntl");
          return -1;
        }
    
      return 0;
    }
    
    //端口由参数argv[1]指定
    int
    main (int argc, char *argv[])
    {
      int sfd, s;
      int efd;
      struct epoll_event event;
      struct epoll_event *events;
    
      if (argc != 2)
        {
          fprintf (stderr, "Usage: %s [port]
    ", argv[0]);
          exit (EXIT_FAILURE);
        }
    
      sfd = create_and_bind (argv[1]);
      if (sfd == -1)
        abort ();
    
      s = make_socket_non_blocking (sfd);
      if (s == -1)
        abort ();
    
      s = listen (sfd, SOMAXCONN);
      if (s == -1)
        {
          perror ("listen");
          abort ();
        }
    
      //除了参数size被忽略外,此函数和epoll_create完全相同
      efd = epoll_create1 (0);
      if (efd == -1)
        {
          perror ("epoll_create");
          abort ();
        }
    
      event.data.fd = sfd;
      event.events = EPOLLIN | EPOLLET;//读入,边缘触发方式
      s = epoll_ctl (efd, EPOLL_CTL_ADD, sfd, &event);
      if (s == -1)
        {
          perror ("epoll_ctl");
          abort ();
        }
    
      /* Buffer where events are returned */
      events = calloc (MAXEVENTS, sizeof event);
    
      /* The event loop */
      while (1)
        {
          int n, i;
    
          n = epoll_wait (efd, events, MAXEVENTS, -1);
          for (i = 0; i < n; i++)
            {
              if ((events[i].events & EPOLLERR) ||
                  (events[i].events & EPOLLHUP) ||
                  (!(events[i].events & EPOLLIN)))
                {
                  /* An error has occured on this fd, or the socket is not
                     ready for reading (why were we notified then?) */
                  fprintf (stderr, "epoll error
    ");
                  close (events[i].data.fd);
                  continue;
                }
    
              else if (sfd == events[i].data.fd)
                {
                  /* We have a notification on the listening socket, which
                     means one or more incoming connections. */
                  while (1)
                    {
                      struct sockaddr in_addr;
                      socklen_t in_len;
                      int infd;
                      char hbuf[NI_MAXHOST], sbuf[NI_MAXSERV];
    
                      in_len = sizeof in_addr;
                      infd = accept (sfd, &in_addr, &in_len);
                      if (infd == -1)
                        {
                          if ((errno == EAGAIN) ||
                              (errno == EWOULDBLOCK))
                            {
                              /* We have processed all incoming
                                 connections. */
                              break;
                            }
                          else
                            {
                              perror ("accept");
                              break;
                            }
                        }
    
                                      //将地址转化为主机名或者服务名
                      s = getnameinfo (&in_addr, in_len,
                                       hbuf, sizeof hbuf,
                                       sbuf, sizeof sbuf,
                                       NI_NUMERICHOST | NI_NUMERICSERV);//flag参数:以数字名返回
                                      //主机地址和服务地址
    
                      if (s == 0)
                        {
                          printf("Accepted connection on descriptor %d "
                                 "(host=%s, port=%s)
    ", infd, hbuf, sbuf);
                        }
    
                      /* Make the incoming socket non-blocking and add it to the
                         list of fds to monitor. */
                      s = make_socket_non_blocking (infd);
                      if (s == -1)
                        abort ();
    
                      event.data.fd = infd;
                      event.events = EPOLLIN | EPOLLET;
                      s = epoll_ctl (efd, EPOLL_CTL_ADD, infd, &event);
                      if (s == -1)
                        {
                          perror ("epoll_ctl");
                          abort ();
                        }
                    }
                  continue;
                }
              else
                {
                  /* We have data on the fd waiting to be read. Read and
                     display it. We must read whatever data is available
                     completely, as we are running in edge-triggered mode
                     and won't get a notification again for the same
                     data. */
                  int done = 0;
    
                  while (1)
                    {
                      ssize_t count;
                      char buf[512];
    
                      count = read (events[i].data.fd, buf, sizeof(buf));
                      if (count == -1)
                        {
                          /* If errno == EAGAIN, that means we have read all
                             data. So go back to the main loop. */
                          if (errno != EAGAIN)
                            {
                              perror ("read");
                              done = 1;
                            }
                          break;
                        }
                      else if (count == 0)
                        {
                          /* End of file. The remote has closed the
                             connection. */
                          done = 1;
                          break;
                        }
    
                      /* Write the buffer to standard output */
                      s = write (1, buf, count);
                      if (s == -1)
                        {
                          perror ("write");
                          abort ();
                        }
                    }
    
                  if (done)
                    {
                      printf ("Closed connection on descriptor %d
    ",
                              events[i].data.fd);
    
                      /* Closing the descriptor will make epoll remove it
                         from the set of descriptors which are monitored. */
                      close (events[i].data.fd);
                    }
                }
            }
        }
    
      free (events);
    
      close (sfd);
    
      return EXIT_SUCCESS;
    }

    转自:

    http://blog.csdn.net/xiajun07061225/article/details/9250579

  • 相关阅读:
    题解报告——垃圾陷阱
    后缀自动机
    计算几何之凸包
    平衡树——treap
    图论--最小费用最大流(MCMF)
    很重要的吐槽!
    图论--网络流初步(最大流,增广路)
    字符串--Trie树(字典树)
    图论--Tarjan求强联通分量
    数据结构--堆
  • 原文地址:https://www.cnblogs.com/ljygoodgoodstudydaydayup/p/5374136.html
Copyright © 2011-2022 走看看