首页 > 代码库 > 使用R完成字符串的子字符串频率统计
使用R完成字符串的子字符串频率统计
整理自统计之都论坛
方法一 使用strsplit函数
a <- "aggcacggaaaaacgggaataacggaggaggacttggcacggcattacacggagg" b <- strsplit(as.character(a),"ag") length(b[[1]]) - 1 ##子字符串"ag"的出现个数
方法二 使用正则式函数
a <- "aggcacggaaaaacgggaataacggaggaggacttggcacggcattacacggagg" b <- strsplit(as.character(a),"ag") regexpr("ag",a) gregexpr("ag",a) gregexpr("a.g",a) attr(gregexpr("a.g",a)[[1]], "match.length") #提取子模式长度
方法三 使用str_count函数
library(stringr) str_count("1212345", c("12", "23", "00"))
一个使用实例
计算a*g中间有0-5个任意字母的频率
library(stringr) str <- "aggcacggaaaaacgggaataacggaggaggacttggcacggcattacacggagg" n <- 0:5 patterns <- sapply(n,function(i) { paste0("a\\w{",i,"}g") }) counts <- str_count(str,patterns) names(counts) <- n counts
声明:以上内容来自用户投稿及互联网公开渠道收集整理发布,本网站不拥有所有权,未作人工编辑处理,也不承担相关法律责任,若内容有误或涉及侵权可进行投诉: 投诉/举报 工作人员会在5个工作日内联系你,一经查实,本站将立刻删除涉嫌侵权内容。