国产探花免费观看_亚洲丰满少妇自慰呻吟_97日韩有码在线_资源在线日韩欧美_一区二区精品毛片,辰东完美世界有声小说,欢乐颂第一季,yy玄幻小说排行榜完本

首頁 > 開發 > PHP > 正文

PHP改進計算字符串相似度的函數similar_text()、levenshtein()

2024-05-04 23:26:24
字體:
來源:轉載
供稿:網友
PHP 原生的similar_text()函數、levenshtein()函數對中文漢字支持不好,我自己寫了一個,測試使用正常,推薦給大家,如果有什么問題,請留言
 
 

similar_text()中文漢字版

 

復制代碼代碼如下:

     <?php  
     //拆分字符串  
     function split_str($str) {  
       preg_match_all("/./u", $str, $arr);  
       return $arr[0];  
     }  
       
     //相似度檢測  
     function similar_text_cn($str1, $str2) {  
       $arr_1 = array_unique(split_str($str1));  
       $arr_2 = array_unique(split_str($str2));  
       $similarity = count($arr_2) - count(array_diff($arr_2, $arr_1));  
         
       return $similarity;  
     }   

 

levenshtein()中文漢字版
 

 

復制代碼代碼如下:

     <?php  
     //拆分字符串  
     function mbStringToArray($string, $encoding = 'UTF-8') {  
         $arrayResult = array();  
         while ($iLen = mb_strlen($string, $encoding)) {  
             array_push($arrayResult, mb_substr($string, 0, 1, $encoding));  
             $string = mb_substr($string, 1, $iLen, $encoding);  
         }  
         return $arrayResult;  
     }  
     //編輯距離  
     function levenshtein_cn($str1, $str2, $costReplace = 1, $encoding = 'UTF-8') {  
         $count_same_letter = 0;  
         $d = array();  
         $mb_len1 = mb_strlen($str1, $encoding);  
         $mb_len2 = mb_strlen($str2, $encoding);  
         $mb_str1 = mbStringToArray($str1, $encoding);  
         $mb_str2 = mbStringToArray($str2, $encoding);  
         for ($i1 = 0; $i1 <= $mb_len1; $i1++) {  
             $d[$i1] = array();  
             $d[$i1][0] = $i1;  
         }  
         for ($i2 = 0; $i2 <= $mb_len2; $i2++) {  
             $d[0][$i2] = $i2;  
         }  
         for ($i1 = 1; $i1 <= $mb_len1; $i1++) {  
             for ($i2 = 1; $i2 <= $mb_len2; $i2++) {  
                 // $cost = ($str1[$i1 - 1] == $str2[$i2 - 1]) ? 0 : 1;  
                 if ($mb_str1[$i1 - 1] === $mb_str2[$i2 - 1]) {  
                     $cost = 0;  
                     $count_same_letter++;  
                 } else {  
                     $cost = $costReplace; //替換  
                 }  
                 $d[$i1][$i2] = min($d[$i1 - 1][$i2] + 1, //插入  
                 $d[$i1][$i2 - 1] + 1, //刪除  
                 $d[$i1 - 1][$i2 - 1] + $cost);  
             }  
         }  
         return $d[$mb_len1][$mb_len2];  
         //return array('distance' => $d[$mb_len1][$mb_len2], 'count_same_letter' => $count_same_letter);  
     }   

 
最長公共子序列LCS()

 
復制代碼代碼如下:

         <?php  
         //最長公共子序列英文版  
         function LCS_en($str_1, $str_2) {  
           $len_1 = strlen($str_1);  
           $len_2 = strlen($str_2);  
           $len = $len_1 > $len_2 ? $len_1 : $len_2;  
           $dp = array();  
           for ($i = 0; $i <= $len; $i++) {  
             $dp[$i] = array();  
             $dp[$i][0] = 0;  
             $dp[0][$i] = 0;  
           }  
           for ($i = 1; $i <= $len_1; $i++) {  
             for ($j = 1; $j <= $len_2; $j++) {  
               if ($str_1[$i - 1] == $str_2[$j - 1]) {  
                 $dp[$i][$j] = $dp[$i - 1][$j - 1] + 1;  
               } else {  
                 $dp[$i][$j] = $dp[$i - 1][$j] > $dp[$i][$j - 1] ? $dp[$i - 1][$j] : $dp[$i][$j - 1];  
               }  
             }  
           }  
           return $dp[$len_1][$len_2];  
         }  
         //拆分字符串  
         function mbStringToArray($string, $encoding = 'UTF-8') {  
           $arrayResult = array();  
           while ($iLen = mb_strlen($string, $encoding)) {  
             array_push($arrayResult, mb_substr($string, 0, 1, $encoding));  
             $string = mb_substr($string, 1, $iLen, $encoding);  
           }  
           return $arrayResult;  
         }  
         //最長公共子序列中文版  
         function LCS_cn($str1, $str2, $encoding = 'UTF-8') {  
           $mb_len1 = mb_strlen($str1, $encoding);  
           $mb_len2 = mb_strlen($str2, $encoding);  
           $mb_str1 = mbStringToArray($str1, $encoding);  
           $mb_str2 = mbStringToArray($str2, $encoding);  
           $len = $mb_len1 > $mb_len2 ? $mb_len1 : $mb_len2;  
           $dp = array();  
           for ($i = 0; $i <= $len; $i++) {  
             $dp[$i] = array();  
             $dp[$i][0] = 0;  
             $dp[0][$i] = 0;  
           }  
           for ($i = 1; $i <= $mb_len1; $i++) {  
             for ($j = 1; $j <= $mb_len2; $j++) {  
               if ($mb_str1[$i - 1] == $mb_str2[$j - 1]) {  
                 $dp[$i][$j] = $dp[$i - 1][$j - 1] + 1;  
               } else {  
                 $dp[$i][$j] = $dp[$i - 1][$j] > $dp[$i][$j - 1] ? $dp[$i - 1][$j] : $dp[$i][$j - 1];  
               }  
             }  
           }  
           return $dp[$mb_len1][$mb_len2];  
         } 

發表評論 共有條評論
用戶名: 密碼:
驗證碼: 匿名發表
主站蜘蛛池模板: 津市市| 汉中市| 淮滨县| 宜丰县| 湾仔区| 双江| 华阴市| 周宁县| 博乐市| 赤峰市| 富锦市| 铜陵市| 兰州市| 马龙县| 洮南市| 册亨县| 连云港市| 岢岚县| 瑞安市| 卓尼县| 始兴县| 仁布县| 闽侯县| 岳普湖县| 安化县| 邛崃市| 西吉县| 东城区| 开原市| 突泉县| 同仁县| 吴忠市| 长沙市| 会同县| 文水县| 黑河市| 河曲县| 大余县| 高要市| 吴旗县| 南召县|