使用aggregate在MongoDB中查詢重復數據記錄的方法

2020-10-29 18:50:09

字體：大中小

來源：轉載

供稿：網友

MongoDB中聚合(aggregate)主要用于處理數據(諸如統計平均值,求和等)，并返回計算后的數據結果。有點類似sql語句中的 count(*)。

aggregate() 方法

MongoDB中聚合的方法使用aggregate()。

語法

aggregate() 方法的基本語法格式如下所示：

>db.COLLECTION_NAME.aggregate(AGGREGATE_OPERATION)

我們知道，MongoDB屬于文檔型數據庫，其存儲的文檔類型都是JSON對象。正是由于這一特性，我們在Node.js中會經常使用MongoDB進行數據的存取。但由于Node.js是異步執行的，這就導致我們無法保證每一次的數據庫save操作都是原子型的。也就是說，如果客戶端連續兩次發起同一事件將數據存入數據庫，很可能會導致數據被重復保存。高并發的情況下，哪怕是你在代碼中已經做了非常嚴格的校驗，例如插入數據前判斷要保存的數據是否已經存在，但仍然有可能會出現數據被重復保存的風險。因為在異步執行中，你沒有辦法保證哪個線程先執行，哪個線程后執行，客戶端發起的所有請求并非按我們想象的都是順序執行的。一個較好的解決辦法是在Mongo數據庫的所有表中創建唯一索引。事實上，MongoDB默認會為所有表創建一個_id字段的唯一索引（可以取消）。如果你想在Node.js中通過mongoose.schema來自動創建索引，可以參考下面的代碼：

var mongoose = require('mongoose');var Schema = mongoose.Schema;var customerSchema = new mongoose.Schema({cname: String,cellPhone, String,sender: String,tag: String,behaviour: Number,createTime: {type: Date,default: Date.now},current:{type: Boolean,default: true}}, {versionKey: false});customerSchema.index({cname:1,cellPhone:1,sender:1,tag:1,behaviour:1}, {unique: true});module.exports = mongoose.model('customer', customerSchema);

　　上面的model中我們定義了表customer的結構，并通過index()方法在字段cname，cellPhone，sender，tag，behaviour上創建了唯一索引，這樣當包含這些字段的重復數據被插入時，數據庫會拋出異常。借用mongoose，如果數據庫表之前已經被創建并且程序正在運行中，當我們修改model并添加索引，然后重新啟動app，只要有對該model的訪問，mongoose會自動進行檢測并創建索引。當然，如果數據出現重復，則索引創建會失敗。此時我們可以通過在創建索引時添加dropDups選項，讓數據庫自動將重復的數據刪除，如：

customerSchema.index({cname:1,cellPhone:1,sender:1,tag:1,behaviour:1}, {unique: true, dropDups: true});

　　不過據MongoDB的官方說明，自3.0以后的版本不再使用該選項，而且也并沒有提供替代的解決辦法。貌似官方不再提供創建索引時自動刪除重復記錄的功能。那如何才能快速有效地找出重復的記錄并且刪除呢？首先我們要找出這些記錄，然后通過remove()方法進行刪除。下面的查詢語句可以找出給定字段有重復數據的記錄：

db.collection.aggregate([{ $group: { _id: { firstField: "$firstField", secondField: "$secondField" }, uniqueIds: { $addToSet: "$_id" },count: { $sum: 1 } }}, { $match: { count: { $gt: 1 } }}])

　　替換_id屬性的值以指定你想要進行判斷的字段。相應地，在Node.js中代碼如下：

var deferred = Q.defer();var group = { firstField: "$firstField", secondField: "$secondField"};model.aggregate().group({_id: group,uniqueIds: {$addToSet: '$_id'},count: {$sum: 1}}).match({ count: {$gt: 1}}).exec(deferred.makeNodeResolver());return deferred.promise;

上述代碼使用了Q來替換函數執行中的回調。在Node.js的異步編程中，使用Q來處理回調是個不錯的選擇。

　　下面是返回的結果：

/* 1 */{"result" : [ {"_id" : {"cellPhone" : "15827577345","actId" : ObjectId("5694565fa50fea7705f01789")},"uniqueIds" : [ ObjectId("569b5d03b3d206f709f97685"), ObjectId("569b5d01b3d206f709f97684")],"count" : 2.0000000000000000}, {"_id" : {"cellPhone" : "18171282716","actId" : ObjectId("566b0d8dc02f61ae18e68e48")},"uniqueIds" : [ ObjectId("566d16e6cf86d12d1abcee8b"), ObjectId("566d16e6cf86d12d1abcee8a")],"count" : 2.0000000000000000}],"ok" : 1.0000000000000000}

　　從結果中可以看到，一共有兩組數據相同的記錄，所以返回的result數組的長度為2。uniqueIds屬性為一個數組，其中存放了重復記錄的_id字段的值，通過該值我們可以使用remove()方法來查找并刪除對應的數據。

上一篇：mongodb使用心得簡單總結

下一篇：MongoDB索引使用詳解