国产探花免费观看_亚洲丰满少妇自慰呻吟_97日韩有码在线_资源在线日韩欧美_一区二区精品毛片,辰东完美世界有声小说,欢乐颂第一季,yy玄幻小说排行榜完本

首頁 > 編程 > JavaScript > 正文

使用Node.js處理前端代碼文件的編碼問題

2019-11-20 10:35:31
字體:
來源:轉載
供稿:網友

使用 NodeJS 編寫前端工具時,操作得最多的是文本文件,因此也就涉及到了文件編碼的處理問題。我們常用的文本編碼有 UTF8 和 GBK 兩種,并且 UTF8 文件還可能帶有 BOM。在讀取不同編碼的文本文件時,需要將文件內容轉換為 JS 使用的 UTF8 編碼字符串后才能正常處理。

BOM 的移除
BOM 用于標記一個文本文件使用 Unicode 編碼,其本身是一個 Unicode 字符("/uFEFF"),位于文本文件頭部。在不同的 Unicode 編碼下,BOM 字符對應的二進制字節如下:

  Bytes   Encoding----------------------------  FE FF    UTF16BE  FF FE    UTF16LE  EF BB BF  UTF8

因此,我們可以根據文本文件頭幾個字節等于啥來判斷文件是否包含 BOM,以及使用哪種 Unicode 編碼。但是,BOM 字符雖然起到了標記文件編碼的作用,其本身卻不屬于文件內容的一部分,如果讀取文本文件時不去掉 BOM,在某些使用場景下就會有問題。例如我們把幾個 JS 文件合并成一個文件后,如果文件中間含有 BOM 字符,就會導致瀏覽器 JS 語法錯誤。因此,使用 NodeJS 讀取文本文件時,一般需要去掉 BOM。例如,以下代碼實現了識別和去除 UTF8 BOM 的功能。

function readText(pathname) {  var bin = fs.readFileSync(pathname);  if (bin[0] === 0xEF && bin[1] === 0xBB && bin[2] === 0xBF) {    bin = bin.slice(3);  }  return bin.toString('utf-8');}

GBK 轉 UTF8
NodeJS 支持在讀取文本文件時,或者在 Buffer 轉換為字符串時指定文本編碼,但遺憾的是,GBK 編碼不在NodeJS自身支持范圍內。因此,一般我們借助 iconv-lite 這個三方包來轉換編碼。使用 NPM 下載該包后,我們可以按下邊方式編寫一個讀取 GBK 文本文件的函數。

var iconv = require('iconv-lite');function readGBKText(pathname) {  var bin = fs.readFileSync(pathname);  return iconv.decode(bin, 'gbk');}

單字節編碼
有時候,我們無法預知需要讀取的文件采用哪種編碼,因此也就無法指定正確的編碼。比如我們要處理的某些 CSS 文件中,有的用 GBK 編碼,有的用 UTF8 編碼。雖然可以一定程度可以根據文件的字節內容猜測出文本編碼,但這里要介紹的是有些局限,但是要簡單得多的一種技術。

首先我們知道,如果一個文本文件只包含英文字符,比如 Hello World,那無論用 GBK 編碼或是 UTF8 編碼讀取這個文件都是沒問題的。這是因為在這些編碼下,ASCII0~128 范圍內字符都使用相同的單字節編碼。

反過來講,即使一個文本文件中有中文等字符,如果我們需要處理的字符僅在 ASCII0~128 范圍內,比如除了注釋和字符串以外的JS代碼,我們就可以統一使用單字節編碼來讀取文件,不用關心文件的實際編碼是 GBK 還是 UTF8。以下示例說明了這種方法。

1. GBK編碼源文件內容:

  var foo = '中文';

2. 對應字節:

  76 61 72 20 66 6F 6F 20 3D 20 27 D6 D0 CE C4 27 3B

3. 使用單字節編碼讀取后得到的內容:

  var foo = '{亂碼}{亂碼}{亂碼}{亂碼}';

4. 替換內容:

  var bar = '{亂碼}{亂碼}{亂碼}{亂碼}';

5. 使用單字節編碼保存后對應字節:

  76 61 72 20 62 61 72 20 3D 20 27 D6 D0 CE C4 27 3B

6. 使用 GBK 編碼讀取后得到內容:

  var bar = '中文';

這里的訣竅在于,不管大于 0xEF 的單個字節在單字節編碼下被解析成什么亂碼字符,使用同樣的單字節編碼保存這些亂碼字符時,背后對應的字節保持不變。

NodeJS 中自帶了一種 binary 編碼可以用來實現這個方法,因此在下例中,我們使用這種編碼來演示上例對應的代碼該怎么寫。

function replace(pathname) {  var str = fs.readFileSync(pathname, 'binary');  str = str.replace('foo', 'bar');  fs.writeFileSync(pathname, str, 'binary');}

發表評論 共有條評論
用戶名: 密碼:
驗證碼: 匿名發表
主站蜘蛛池模板: 遂平县| 分宜县| 东莞市| 仙居县| 盘锦市| 聊城市| 社旗县| 彭泽县| 德兴市| 五大连池市| 资溪县| 阿尔山市| 元朗区| 铜山县| 天柱县| 鸡泽县| 枝江市| 图木舒克市| 黄龙县| 绥化市| 商丘市| 昌乐县| 长垣县| 上犹县| 奉贤区| 额尔古纳市| 新化县| 海盐县| 阿合奇县| 乌什县| 曲靖市| 静安区| 社旗县| 涟源市| 吴忠市| 东乌珠穆沁旗| 祁连县| 凉山| 花垣县| 闸北区| 巴马|