Perl遍历目录和使用Linux命令分析日志的代码实例分享(perl怎么读)一看就会

随心笔谈9个月前发布 admin
202 00
🌐 经济型:买域名、轻量云服务器、用途:游戏 网站等 《腾讯云》特点:特价机便宜 适合初学者用 点我优惠购买
🚀 拓展型:买域名、轻量云服务器、用途:游戏 网站等 《阿里云》特点:中档服务器便宜 域名备案事多 点我优惠购买
🛡️ 稳定型:买域名、轻量云服务器、用途:游戏 网站等 《西部数码》 特点:比上两家略贵但是稳定性超好事也少 点我优惠购买

文章摘要

本文介绍了一种使用 Perl 和 bash 脚本处理 nginx 日志文件的方法。脚本的主要功能包括: 1. 设置当前工作目录并遍历指定目录(如 `/root/Documents/images`) 2. 读取 nginx 日志文件(如 `access_201209.log`),并查找指定目录下的文件访问情况 3. 使用正则表达式匹配文件名并统计其出现次数 4. 将结果写入指定文件(如 `result.f`) 5. 处理后已记录的文件会自动被删除,确保脚本的持续性 6. 最后提到了删除访问次数为零的记录的方法 该脚本通过递归函数 `find_dir` 实现目录遍历功能,能够高效地处理大量日志数据,并生成结构化的统计结果。

#! /usr/bin/perl -w

$path=’/root/Documents’;  # 当前工作目录

$dir=”$path/images”; # 要遍历的目录

$log_file=”$path/access_201209.log”; # nginx日志0903~0907,  filesize: 5.4G

$result_file=’result.f’;  # 放置结果的文件

if(!open $output, “>>$result_file”) { # 以追加的形式打开文件

         die ” Open file failed: $!”;

}

&find_dir($dir);

sub find_dir() {

        my $base_dir=$_[0]; # $_[0]表示子例程(函数)的第一个参数

        if( !opendir(DIR,”$base_dir”) ) {

                warn “open dir failed: $! \n”;

        }

        my @father_dir=readdir(DIR); # 资源转储

        closedir(DIR);                 

        $base_dir=~ s//$//; # 删除目录最后面的 /

        foreach $sub_dir (@father_dir) {

                if($sub_dir=~ /^\https://www.jb51.net/article/)  { # 过滤掉 . 和 .. 以及 隐藏文件

                        next;

                }

                if(-d “$base_dir/$sub_dir”) { # 如果是目录则回调

                     &find_dir(“$base_dir/$sub_dir”); # 引用递归函数,避免在内存中开辟多个副本

                }elsif (-f “$base_dir/$sub_dir”) { # 如果是文件则….

                 # 文件前面保留一个空格,这样才能保证不会搜索到 theme_skin/blue/images 这样的目录

                 my $this_file=” $base_dir/$sub_dir”;

                 $this_file=~ s/$path//;           # 删除掉字符串 /root/Documents

                 # 使用Linux命令,在 [$log_file文件] 中查找 [$this_file字符串] 并统计字符串出现的次数

                 my $result=`grep -c  “$this_file”  $log_file`;  # $this_file要用双引号括起来,防止图片名称中有空格造成程序错误

                 chomp  $result ;  # 删除Linux执行命令后,返回值所带有的换行符

                 print $output “$this_file :         $result \n”;  # 将处理结果写入$output指定的文件

                 # 已经记录过的文件删除掉,这样每次终止脚本的时候,都能继续之前的内容进行查找

                 unlink “$base_dir/$sub_dir”;

                }

        }

}

print “\n Finished \n”;

# 现在打开 result.f 文件,把 /images/ 替换成 images/   这样才能在当前工作目录中删除文件

# Linux命令查找5天内被访问0次的记录,并删除

# 数字0 左右两边要有空格,防止找到文件名中含有0的记录

# 方法 1 :

# gawk -F ‘:’ ‘$2 ~ / 0 / {print $1}’ result.f | xargs rm -rf

# 方法 2 :  (完全等同 方法1)

# grep ‘ 0 ‘ result.f | gawk -F ‘:’ ‘{print $1}’ | xargs rm -rf

© 版权声明

相关文章