RecommenderSystems (215) — 2/2


Paper/Blog Link My Issue
#Article #Tools #Library #One-Line Notes Issue Date: 2018-01-01 Comment

実装されているアルゴリズム:協調フィルタリング、Matrix Factorizationなど

実装:C#

使用方法:コマンドライン、C#ライブラリとして利用

※ ライブラリとして使用する場合は、C#による実装が必要

参考:

http://www.kamishima.net/archive/recsysdoc.pdf

https://takuti.me/note/recommender-libraries/




Paper/Blog Link My Issue
#Article #Library #python #Selected Papers/Blogs #One-Line Notes Issue Date: 2018-01-01 Comment

実装されているアルゴリズム:協調フィルタリング、Matrix Factorizationなど

実装:python

使用方法:pythonライブラリとして利用

※ pythonで利用できる数少ない推薦システムライブラリ

参考:

http://www.kamishima.net/archive/recsysdoc.pdf

https://takuti.me/note/recommender-libraries/




Paper/Blog Link My Issue
#Article #RelevanceJudgment #One-Line Notes Issue Date: 2017-12-28 Comment

・informative relevance: 知識を求める検索など(個人のブログ,経済ニュースとか)

・affective relevance: 楽しみや感情に刺激を受けるための情報を求める検索の場合(2chまとめとか,哲学ニュースまとめとか?)



・topicality, novelty, reliabilityがsignificantにinformative relevanceに寄与, scopeとunderstandabilityは寄与せず

・topicality, understandabilityがsignificantにaffective relevanceに寄与,しかし,noveltyはそうではなかった.




Paper/Blog Link My Issue
#Article #CollaborativeFiltering #Novelty #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2017-12-28 Comment

・従来のCFはaccuracyをあげることを目的に研究されてきたが,ユーザがすでに知っているitemを推薦してしまう問題がある.おまけに(推薦リスト内のアイテムの観点からみた)diversityも低い.このような推薦はdiscoveryがなく,user satisfactionを損ねるので,ユーザがすでに何を知っているかの情報を使ってよりdiscoveryのある推薦をCFでやりましょうという話.

・特徴としてユーザのitemへのratingに加え,そのitemをユーザが知っていたかどうかexplicit feedbackしてもらう必要がある.

・手法は単純で,User-based,あるいはItem-based CFを用いてpreferenceとあるitemをユーザが知っていそうかどうかの確率を求め,それらを組み合わせる,あるいはrating-matrixにユーザがあるitemを知っていたか否かの数値を組み合わせて新たなmatrixを作り,そのmatrix上でCFするといったもの.

・offline評価の結果,通常のCF,topic diversification手法と比べてprecisionは低いものの,discovery ratioとprecision(novelty)は圧倒的に高い.

・ユーザがitemを知っていたかどうかというbinary ratingはユーザに負荷がかかるし,音楽推薦の場合previewがなければそもそも提供されていないからratingできないなど,必ずしも多く集められるデータではない.そこで,データセットのratingの情報を25%, 50%, 75%に削ってratingの数にbiasをかけた上で実験をしている.その結果,事前にratingをcombineし新たなmatrixを作る手法はratingが少ないとあまりうまくいかなかった.

・さらにonlineでuser satisfaction(3つの目的のもとsatisfactionをratingしてもらう 1. purchase 2. on-demand-listening 3. discovery)を評価した. 結果,purchaseとdiscoveryにおいては,ベースラインを上回った.ただし,これは推薦リスト中の満足したitemの数の問題で,推薦リスト全体がどうだった

 かと問われた場合は,ベースラインと同等程度だった.

重要論文




Paper/Blog Link My Issue
#Article #Novelty #RecSys #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2017-12-28 Comment

・典型的なRSは,推薦リストのSimilarityとNoveltyのcriteriaを最適化する.このとき,両者のバランスを取るためになんらかの定数を導入してバランスをとるが,この定数はユーザやタイミングごとに異なると考えられるので(すなわち人やタイミングによってnoveltyのpreferenceが変化するということ),それをuserの過去のbehaviorからpredictするモデルを考えましたという論文.

・式中によくtが出てくるが,tはfamiliar setとnovel setをわけるためのみにもっぱら使われていることに注意.昼だとか夜だとかそういう話ではない.familiar setとは[t-T, t]の間に消費したアイテム,novel setはfamiliar setに含まれないitemのこと.

・データはmusic consumption logsを使う.last.fmやproprietary dataset.データにlistening以外のexplicit feedback (rating)などの情報はない

・itemのnoveltyの考え方はユーザ側からみるか,システム側から見るかで分類が変わる.三種類の分類がある.



(a) new to system: システムにとってitemが新しい.ゆえにユーザは全員そのitemを知らない.

(b) new to user: システムはitemを知っているが,ユーザは知らない.

(c) oblivious/forgotten item: 過去にユーザが知っていたが,最後のconsumptionから時間が経過しいくぶんunfamiliarになったitem



Repetition of forgotten items in future consumptions has been shown to produce increased diversity and emotional excitement.



この研究では(b), (c)を対象とする.



・userのnovelty preferenceについて二つの仮定をおいている.

1. ユーザごとにnovelty preferenceは違う.

2. ユーザのnovelty preferenceはdynamicに変化する.trainingデータを使ってこの仮定の正しさを検証している.



・novelty preferenceのpredictは二種類の素性(familiar set diversityとcumulative negative preference for items in the familiar set)を使う. 前者は,familiar setの中のradioをどれだけ繰り返しきいているかを用いてdiversityを定義.繰り返し聞いているほうがdiversity低い.後者は,異なるitemの消費をする間隔によってdynamic preference scoreを決定.familiar set内の各itemについて負のdynamic preference scoreをsummationすることで,ユーザの”退屈度合い”を算出している.

・両素性を考慮することでnovelty preferenceのRMSEがsignificantに減少することを確認.

・推薦はNoveltyのあるitemの推薦にはHijikataらの協調フィルタリングなどを使うこともできる.

・しかし今回は簡易なitem-based CFを用いる.ratingの情報がないので,それはdynamic preference scoreを代わりに使い各itemのスコアを求め,そこからnovel recommendationとfamiliar recommendationのリストを生成し,novelty preferenceによって両者を組み合わせる.

・音楽(というより音楽のradioやアーティスト)の推薦を考えている状況なので,re-consumptionが許容されている.Newsなどとは少しドメインが違うことに注意.




Paper/Blog Link My Issue
#Article #Document #NewsRecommendation #Personalization #SIGIR #One-Line Notes Issue Date: 2017-12-28 Comment

・ニュース推薦には3つのチャレンジがある。



1. スケーラビリティ より高速なreal-time processing

2. あるニュース記事を読むと、続いて読む記事に影響を与える

3. popularityとrecencyが時間経過に従い変化するので、これらをどう扱うか



これらに対処する手法を提案




Paper/Blog Link My Issue
#Article #Document #One-Line Notes Issue Date: 2017-12-28 Comment

・traditionalなkeywordベースでマッチングするアプローチだと,単語間の意味的な関係によって特定の単語のoverweightやunderweightが発生するので,advancedなsemanticsを考慮した手法が必要なので頑張りますという論文.




Paper/Blog Link My Issue
#Article #Document #KeyPoint Notes Issue Date: 2017-12-28 Comment

・traditionalなmethodはweb usage or web content mining techniquesを用いているが,ニュースサイトなどのページは日々更新されるのでweb content mining techniquesを用いてモデルを更新するのはしんどい.ので,web usage mining(CFとか?どちらかというとサーバログからassociation ruleを見つけるような手法か)にフォーカス.

・web usage miningに基づく様々な手法をhybridすることでどれだけaccuracyが改善するかみる.

・ユーザがセッションにおいて次にどのページを訪れるかをpredictし推薦するような枠組み(不特定多数のページを母集団とするわけではなく,自分のサイト内のページが母集団というパターンか)

・4種類の既存研究を紹介し,それらをどうcombineするかでaccuraryがどう変化しているかを見ている.

・それぞれの手法は,ユーザのsessionの情報を使いassociation rule miningやclusteringを行い次のページを予測する手法.




Paper/Blog Link My Issue
#Article #NeuralNetwork #Document #DataFiltering #KeyPoint Notes Issue Date: 2017-12-28 Comment

・ポルノコンテンツのフィルタリングが目的. 提案手法はgeneral frameworkなので他のコンテンツのフィルタリングにも使える.

・NNを採用する理由は,robustだから(様々な分布にfitする).Webpageはnoisyなので.

・trainingのためにpornographic pageを1009ページ(13カテゴリから収集),non-pornographic pageを3,777ページ収集.

・feature(主なもの)

 - indicative term(ポルノっぽい単語)の頻度

 - displayed contents ページのタイトル,warning message block, other viewable textから収集

 - non-displayed contents descriptionやkeywordsなどのメタデータ,imageタグのtextなどから収集

・95%くらいのaccuracy