スキップしてメイン コンテンツに移動

投稿

ラベル(統計)が付いた投稿を表示しています

マストバイはどれ? - ベストセラーコード

『ベストセラーコード 「売れる文章」を見きわめる驚異のアルゴリズム』を読んだ。 本書は「この本は売れるか?」を予測する統計モデルについて書かれた本。その統計モデルに基づいて、ベストセラーが備える特徴が分析されている。念のため言っておくと、「こう書けば売れる」というノウハウが書かれたハウツー本ではない。 その統計モデルは、そっくりそのまま日本で流通している本にも当てはまるわけではなさそう。分析対象がアメリカで流通している本で、売れた本としてニューヨークタイムズでベストセラー入りした本を使っている。たとえば、ベストセラー入りしやすいページ数は、日本では違う結果が出そう。アメリカでベストセラー入りしやすい本は300ページ前後だと言っているけれど、言葉や組版の違いで1ページあたりの情報量が違う [1] 。 でも、言語に非依存で、普遍的に当てはまる特徴も多いように思う。ページ数のような物理的な制約はともかく、人間が受け止めやすい情報量には大差はないだろう。トピックの数が多過ぎず、メイントピックに紙幅の1/3充てられているだとか、そのトピックは多くの読者にとって身近なものであるだとかは、古今東西を問わないんじゃないだろうか。どんなトピックが身近かは、市場によって変わるにしろ。なかでもが好奇心がそそられたのは、ベストセラーに見られるプロットのパターン。大別するとたった7つに収まるらしい。世界各地で独立に語り継がれたであろう神話に類型があるという説とも符合する(誰か検証していたりするんだろうか)。 こうしてベストセラー入りした本とそれらが備えている特徴を眺めていると、ベストセラーの中にも自分が好きな本と読みそうにない本が入り交じっていることに気がつく。例えば、 〈ミレニアム〉シリーズ は寝る間も惜しんで読み進めるくらいだったけれど、ジョン・グリシャムの著作にはどうも食指が動かない(よく目立つ場所に置いてあるので名前だけは知っているけれど)。読んだらハマッタリするんだろうか。 各章の末尾でその章で論じられたベストセラーの特徴を備える本がランキング形式で挙げられているので、読書ガイドとして読んでも有用。パーソナライズこそされていないものの、自分が好きなベストセラーと同じ特徴を持つベストセラーがリコメンデーションされたリストとして使うことができる。自分が、未読で邦訳が...

分析気分 - ナンバーセンス

『ナンバーセンス』を読んだ。『ヤバい統計学』の著者による、統計リテラシーの本。数字に踊らされないための一冊。楽しむのに、統計分析について知らなくても大丈夫。統計分析は主題じゃない。 統計リテラシーの本は昔からあるけれど [1] 、「ビッグデータ」というバズワードに乗っかって、「分析」が増えている。その中には問題がある分析も多い [2] から、騙されないようにしよう。そういう話。 騙されないためのポイントの一つが、「反事実」という考え方。ここでは、クーポンを例に使って説明されている。雑に説明するとこんな感じ。 クーポン発行業者の主張する世界: クーポンの集客効果で○○○円売り上げが増えた。 反事実の世界:クーポンなんか出さなくても売れた分の割引分の利益を失ったうえ、クーポン発行手数料まで取られた。 現実は中間にある。クーポンがあってもなくても買う人と、クーポンがなければ買わなかった人がいるはずだ。その比率でクーポンの効果は変わる。もう少し想像を広げると、クーポンの発行は、きっとクーポンがあってもなくても買う人を減らす力として働くだろう。しょっちゅう値引きされるのを知っていたら、値引きなしで買うのバカらしくない? この他にも、大学のランキングを操作するためのあの手この手とか、基準値を巡るいざこざ(でも結局どれも大差がなさそう)とか、数字を巡るドラマを見せてくれる。 そして、エピローグで著者はこう語る。 ほとんどの場合、あなたが自分でデータを扱う必要は無い。誰もひとりですべてを検証する時間は無い。それでも、その数字の出所を知れば理解が深まる。その仮説がいつどのように立てられたかを知ることも、同じくらい重要だ。 データの出所も仮説の立てられ方も様々だけれど、好奇心を満たすためだけの分析でなければ、その目的は主張する仮説の補強だ。だから、ほぼ例外なく主張に合わない側面が切り捨てられる。それに、普通は主張に反対する人は、データ収集に積極的に収集したりしない。 そう考えると、大抵の数字は安全率をかけて受け止めておくといいのかもしれない。 [1] 1968年に出版された『統計でウソをつく法』とか。 [2] 問題がある分析を見ると悪意を感じるけれど、経験上、SNSで晒す前に一呼吸置いた方がいい。大半は単純な考慮不足だ。「ハンロンの剃刀」を思い出そ...

Bad Meets Noble - バッドデータハンドブック

『バッドデータハンドブック』を読んだ。 「ハンドブック」という言葉からパターンなりノウハウなりがまとまっているかと思っていたけれど、どちらかというとエッセイ風な印象を受けた。そもそも体系的に扱えないのがバッドデータだから、期待が過剰だったか。 本当に色々な話がある。「1章 はじめに:バッドデータとは何か?」ではこんな風に整理されている。 泥臭い実務のためのアドバイス 2章 気のせいかな。このデータ、何かおかしくないか? 3章 機械ではなく人間が使うことを意図したデータ 4章 プレーンテキストに潜むバッドデータ 5章 Webにあるデータの(再)構成 予期せぬことをするデータ 6章 オンラインレビューから嘘つきと混乱した人を発見する 9章 データと現実が一致しないとき アプローチ 8章 血と汗と尿 7章 バッドデータは起立して 10章 バイアスとエラーの源 11章 最善は善の敵、バッドデータは本当にバッドなのか? データストレージとインフラ 13章 Crouching Table, Hidden Network 14章 クラウドコンピューティングの神話 12章 ファイルにこだわる データのビジネス面 16章 機械学習の専門家の手なづけ方 15章 データサイエンティストのダークサイド データポリシー 17章 データ追跡可能性 18章 ソーシャルメディア:消去可能インク? 19章 データ品質分析の解明:データが十分良いときを知る 面白かったのは、2~4章と、10, 11章。バッドデータしかないときにどう取り組むか、先人の知恵に学びたい。特に「11章 最善は善の敵、バッドデータは本当にバッドなのか?」が示すバッドデータへの見方はすぐにでも。 データに基づかない判断より、不完全なデータに基づいた判断の方が良いのです。 バッドデータからだって分かることがあるんだから。

vs Vis - インフォグラフィック

『インフォグラフィックス』を読んだ。 著者の作品解説がメインだったけれど、想像していたよりは技法(テクニック)寄りだった。漠然とだけれど、もっと技芸(アート)寄りかと思っていたので、少し身近に感じられた。 でも、やっぱりしっくりこない。特に、3. Graph。 『統計でウソをつく法』 や 『エンジニアのためのデータ可視化[実践]入門』 でウソや過ちとして紹介されそうな3D系のグラフが載っている。誤解を与える可能性について言及しているから、多少は控えているのだろうけれど、自分の許容範囲を超えている。 それでも最後まで読んだら、載っていたワークショップ参加者の声がキッカケで、多少はスッキリした。端的に言うと、インフォグラフィックは単方向ブロードキャスト。可視化は双方向インタラクション。グラデーションはあるにせよ。 言い換えると、インフォグラフィックの目的は、誤解の少ないコミュニケーションや発見的なディスカッションじゃない。発信者不在の状況で発信者の意図を通すことだ。例えば、路線図は乗客だけで見ると想定されている。UMLでコミュニケーションしたり、可視化したデータを見せてディスカッションしたりするのと対照的。 と、ここまで考えて先日読んだ 『阿部博史氏×櫻田潤氏対談(前編)~データジャーナリズムとインフォグラフィック~ - WISDOM』 のこの部分と繋がった。 インフォグラフィックは、編集の要素が入っていてストーリーに見る側を巻き込みやすい データビジュアライズは、読み手への要求度が高い一方、透明性も高い 随分遠回りした気分。でも、上の記事を読んだときは全くピンと来なかったから、必要な道のりだったと思っておこう。

精度の制動 - エンジニアのためのデータ可視化[実践]入門

『エンジニアのためのデータ可視化[実践]入門~D3.jsによるWebの可視化』の「第1部 序」、「第2部 理論」まで読んだ。「第3部 実践」と「第4部 事例」はパス。今のところ、D3.jsを使う予定がない。 タイトルに「実践」とあるけれど、理論が充実しているのがありがたい。未構築ならいざ知らず、理論があるのに無視していては、実行の効率も結果の精度も低くなる。気分的にも、理論に欠ける実践は地に足が着かなくて苦手。 孫引きになるけれど、"The Grammar of Graphics"が示している可視化の仕様がとても参考になる。DATAとかが操作として定義されているのが渋い。 DATA: データセットの中から可視化対象となる変数を決定するデータ操作 TRANS: 変数の変形操作(例:ランキング) SCALE: 変数のスケールの操作(例:対数化) COORD: 座標系変換操作(例:極座標) ELEMENT: 視覚的な表現の要素の決定(例:線、棒)とその装飾操作(例:色、太さ) GUIDE: ガイド生成操作(例:凡例、軸、目盛) それから表3.6「可視化と視覚変数、データ変数の尺度の対応表」や第5章「可視化によくある過ち」も便利そう。繰り返し参照することになりそう。 第4章「何を可視化すべきか」で書かれているように可視化の目的。つまり可視化で検証したい仮説。あるいは仮説が曖昧なときに探りを入れるための可視化(こちらは第6章「探索的データ解析入門」に書かれている)。可視化自体楽しいから、忘れがちだけれど。 本書でもエピグラフとして採用されているテューキーのこの言葉は、自分も折に触れ思い出すようにしている。 「正しい疑問に対する近似的な解を持つ方が、間違った疑問に対する正確な解を持つよりましである」 細かい数字があると精度も高い印象が出てくるけれど、大抵は見かけだけだし、そもそもそんなに精度が要らないことも多い。

もし、奇しくも駆使

『分析力を駆使する企業』を読んだ。企業の分析力について、現状どのレベルで、次のレベルはどんな状態なのかが分かるように書かれている。 キーワードは次の頭文字を並べて"DELTA"。 Data Enterprise Leadership Target Analyst アメリカのコンサルタントは、この手のキャッチーなワードを考えるのが上手いな、と思う。Enterprise, Leadership, Targetは、分析に限った話ではないにしろ。 この5つの要素に前著『分析力を武器とする企業』で示された発展の5段階を掛け合わせて、各要素の発展過程を示している。どの段階から上がるにしても、一朝一夕にはできそうにないので、持続的に取り組む必要がある。 ただ、経営者向けの内容なので、個人レベルで参考にできることは少なかったと思う。

ラフじゃないグラフ

『グラフィックスのためのRプログラミング ggplot2入門』を読んだ。 本書はRパッケージの一つggplot2についての解説。ggplot2というのは、グラフを描くためのパッケージで、基本グラフィクスより綺麗に描ける。 内容は包括的。サンプルコードを通した使い方から、背後にある設計思想 " The Grammar of Graphics (グラフィックスの文法)" の概説から、データの整形のような実用上のコツまで、幅広くカバーしている。 章構成は、第1章が導入、第2章がqplot関数を使った簡易なプロット。ここからが本番で、第3章が文法、第4, 第5章がggplot関数を使った実践と続く。第6, 7, 8章は応用編で、主にグラフの構成要素を調整する方法について書かれている。最後の第9, 10章は実用上のポイントとして、それぞれデータの整形と繰り返しの避け方について触れられている。 ggplot2自体の解説はもちろん、いざやろうとすると既存のデータをggplotに渡せるように加工する段でハマッたり、データ更新の度に大量のグラフを作り直さなくちゃならなくて大変な思いをしたりするので、9,10章の内容まで含まれているのがありがたい。 気になったのは、カラーに関する章のグラフが白黒印刷なこと。色が異なるはずのグラフが並んでいるんだけれど、紙面ではどうなっているかよく分からないときがある。サンプルコードを実行させれば分かるのだけれど、もっぱら電車の中で読んでいるので、できればカラーにして欲しかった(それはそれで値段が上がるか。ただでさえ高いのに)。

計って統べる

『ヤバい統計学』を読んだ。 タイトルは似通っているけれど、『ヤバい経済学』との直接的な関連はない。間接的には、付注で「さらに学びたい人のための文献」として紹介している。 本書は、統計学が問題を解決する様を描いている。 『その数学が戦略を決める』 や『数学で犯罪を解決する』と同じ方向性。 本書は下記5章からなる。 第1章 ファストパスと交通渋滞 ――平均化を嫌う不満分子 第2章 ホウレン草とクレジットカード ――間違っているからこそわかること 第3章 大学入試とハリケーン保険 ――グループ分けのジレンマ 第4章 ドーピング検査とテロ対策 ――非対称がもたらす動揺 第5章 飛行機事故と宝くじ ――「不可能」が起きるとき 特に面白かったのは、第4章。第一種の過誤と第二種の過誤 (本書の言葉を借りれば、間違った警告と逃したチャンス)について、頭では理解していた。だけど、本書が指摘するように、第二種の過誤=逃したチャンスについてあまり考えを巡らせたことがなかった。 ドーピング検査の例で簡単に説明する。ドーピングしていない人に陽性を示してしまうのが、間違った警告。ドーピングしている人に陰性を示してしまうのが、逃したチャンス。ドーピング違反者を残さず見つけようとすれば、間違った警告が増えてしまう。一方で、間違った警告を減らそうとすれば、逃したチャンスが増えてしまう。つまり、讃えられるべき選手を押しのけて、ドーピングのおかげで成績を残す選手が出てきてしまう。 問題は、間違った警告と逃したチャンスとで、影響が違う点だ。間違った警告を受けたら、その選手の選手生命が絶たれてしまう。一方で、逃したチャンスが増えても、誰が得をして誰が損をしたかは明白ではない。その結果、検査は間違った警告を減らして、逃したチャンスを増やす方向で設計されてしまう。これがサブタイトルの「非対称」だ。 では、どれくらいが妥当かというと、これは統計では決められない。価値判断を伴っている。 じゃあ、統計なんて役に立たないかというと、そうではないと思う。ここまでやって、初めて価値判断が活きると思う。統計的に考慮できることを考慮しないで下した価値判断は、統計的検証で覆される。

マジヤバい

『超ヤバい経済学』 を読んだ。 本書は 『ヤバい経済学』 の続編。 続編と言っても、個別のトピックは直接つながっていないため、『ヤバい経済学』を読んでいなくても面白いと思う。 実際、読んだはずの『ヤバい経済学』の中身をすっかり忘れていたけれど、面白かった。 トピックが直接つながっていないと書いたけれど、本書の「説明のためのノート」(「まえがき」に相当)で著者自身が述べているように、テーマは一貫している。 本書の言葉を借りれば、「人は誘因で動く」だ。「誘因」は「インセンティブ」と読み替えてもいい。 こんなテーマを掲げているのは、通説を事実でひっくり返したいから、だと思う。 でも、それは容易ではない。 「いや、事実を示されたら、自分は素直に考えを改めるよ」という人は、自分の表明選好と顕示選好とを意識できていない可能性の方が高いと思う。 通説は本当に厄介で、事実無根だろうと根付かせるのは容易い。 『戦争広告代理店』 ( 感想 )でPRのプロフェッショナルはこんなことを言っている。 「どんな人間であっても、その人の評判を落とすのは簡単なんです。根拠があろうとなかろうと、悪い評判をひたすら繰り返せばよいのです。ですから、この種の攻撃は大きなダメージにつながることがあります。たとえ事実でなくとも、詳しい事情を知らないテレビの視聴者や新聞の読者は信じてしまいますからね。攻撃への対応策は綿密に練る必要がありました」 哲学における"Principle of Charity( 『哲学の最前線』 では好意の原理")が働いて、とか難しく考えたけれど、そんな原理がなくて片っ端から疑ってかかったとしたら、現実問題、全てを検証できるだけの能力も時間もない。 だから、積極的に信じないにしても、「ああそうなんだ」くらいの肯定的な印象くらいは持ってしまいそう。 付け加えておくと、メディアはテレビや新聞じゃなくてもよい。 何がメディアだろうと、人間は自分の信念を裏付ける情報だけを選択的に記憶する傾向がある(心理学の用語で「確証バイアス」)。 だから、こういう本が、「えーそうだったの!」と思えて、ウンチクとして自慢したくなるような通説を否定する話が書かれたんじゃないのかな、とそう思う。

極値戦

『ウソを見破る統計学』 を読んだ。 本書は、統計学に関する基本的な考え方を紹介している。 3部構成になっていて、第1部・第2部が基本的な内容で、第3部が応用的な内容。 索引を含め、250ページにも満たないけれど、網羅的。 あくまで考え方を示しているだけなので、分かりやすさを重視してあまり数式は出てこないし、各種手法を適用するのは難しい。 第1部・第2部は、平均値や中央値などに始まって、回帰分析・検定まで。 正規性を仮定できない場合も含めて、平均値の差の検定のフローを書いてくれているのがありがたい。 自分が読んだ入門書の類はだいたいここまでの内容で終わっている。 第3部は、待ち行列理論、対数正規分布、ベキ分布、極値統計、グラフ理論を扱っている。 逆にこちらは、それぞれ一冊の専門書になっていることが多い。 ただ、極値統計だけは別。興味があって色々調べたことがあるけれど、そもそも日本語の情報がほとんどない。 少なくとも日本語でこんなに平易に解説しているのは本書くらいだと思う。 導入としては十分。あとは、適用までのハードルをどう越えるか。

DM

『戦略的データマネジメント』 を読んだ。 問題提起と解決に向けた取り組みのとっかかりまでが、主な内容。 まえがきによると、著者はテクニカルな話もできるそうなので、そちらの本も書いて欲しい、と思った。 "Garbage In Garbage Out" 元になるデータがゴミなら、それをどうこねくり回しても、ゴミしか出てこない。 ゴミに従った意志決定も、多分ゴミだ。 おまけにゴミを集めるコストもかかっている。 では元になるデータを綺麗しよう、というのがデータマネジメント。 本書では包括的に書いているけれど、面白かったのはデータ辞書作成の行(くだり)。 「顧客」のような基本的な用語ほどあちこちで様々な用途で使われているため、揉めるそうだ。 大企業ではデータ辞書を作るだけで数年がかりだったそう。 その間に市場が変わったりはしなかったのだろうか。

K3

『明日をどこまで計算できるか?』 を読んだ。 本書は予測モデルにまつわる物語を楽しむ本だと思う。 文章表現を選ぶ際に、読み手へのインパクトが重視されているような印象を受けた。 ところで予測モデルが奉られているのは、利用可能な手法で予測可能な系を対象としてきたから、という側面がある。 利用可能な手法とは方程式のこと。 予測科学が、常微分方程式などの方程式を使いながら発展してきたのは、それが研究対象のシステムにぴったり合っていたからではない。常微分方程式が数学で解けるからだ。 予測可能な系とは、例えば天体の運動のこと。 恒星や惑星の運動を予測する最大の理由は、おそらくは地上で起きるほとんどの出来事とは違って、天体が予測可能な運動をするからであろう。 予測したいと思う系(たとえば経済)の予測モデルは、そもそも存在しないのかも知れない。 モデルは(中略)正確な将来予測は相変わらず難しい。モデルは根底にある系の現在の系の機能を理解するツールとして、とくに力を発揮することが多い。 『歴史の方程式』 と同じだ。 ところで邦題はどうにかならないのだろうか。 計算出来なさそうで、方程式もなさそうなのに。 少なくとも現在はできないのに。 体を表してかつ売れそうな名はないのかな。

アカシックレコードなんてない

『歴史の方程式―科学は大事件を予知できるか』 を読んだ。 『インテリジェンス 武器なき戦争』 と前後して読んだため、情報が歴史に与える影響について考えてしまう。 最終的な影響の大きさは、その初めの原因の大きさとは何の関係もないからだ。 これは、地震の話だけれど、情報にもあてはまるんじゃないか、と思う。 情報が伝わるネットワークの構造を分析したら、面白そう。 そう言えば、実際にやっているんだっけ? 『数学で犯罪を解決する』 にそんなことが書いてあったような記憶が。

危なげない数字

『数字に弱いあなたの驚くほど危険な生活』 を読んだ。 不安を煽るタイトルは、本書の趣旨に反している。 本書は、不要な不安を抱かせるべきではないと言っている。 特に問題にしているのは、不要な(しかも間違った)不安を与える数字だ。 例えば、何かの病気の検査にひっかかったときに本当にその病気である確率 (真陽性率) 。 この確率を、患者はもちろん医者さえも、本当にその病気の人がその検査にひっかかる確率(感度)と取り違えていることが多い。 前者は後者に比べて何十倍も低い。 この誤りは、数字を確率ではなく自然頻度(何人中何人が云々)で表現することで、かなり軽減される。 どのくらい軽減されるかは、本書を読んでみて欲しい。 調査結果が自然頻度で表現されている。 それに、少し考えてみて欲しい。 自分が数字オンチを克服できると、数字が本当は難しくないと、思わせてくれる。 そして、きっと実際に克服できる。 少なくとも、自分はできそう。

とっかかりかカット

『経済物理学の発見』 を読んだ。 本書は全8章からなる。 経済物理学の手法について説明しているのは、主に3, 4章。 それ以前の1, 2章の役割は、導入と背景となる物理学の説明。5章以降は、経済物理学から得られた知見や、筆者の提言。 手法についてもう少し掘り下げて欲しかったと思うけれど、それ以上に、自分の本の選び方がよくなかったのだろうな、と思う。 手法について詳しく知りたかったら、新書じゃなくて専門書を読んだ方が良さそう。 ただ、読み物として面白かったし、経済物理学の誕生・発展の背景も分かりやすかった。 とっかかりとしては、良かったと思っている。

事実だからといって理解できるとは限らない

『金融工学の挑戦』 を読んだ。 『ブラック・スワン』 に通じることが書いてある。 VaRの場合、九九%VaR点の先一%のところにどんな大きな落とし穴が待っていても、それは気にしなくて良いことになる。これがこの指標の大きな欠陥である。 この「大きな落とし穴」が、『ブラック・スワン』の著者タレブがいうところの「悪い方の黒い白鳥」にあたる。 欠陥の原因は、収益率が正規分布しているという仮定だ。 本書によると、この仮定は七十年代に否定されている。 それにも関わらず、なぜ今でも正規分布が持て囃されているのだろうか。 正規分布が真の分布の良い近似になっているの分野ではもちろん使えばいいのだけれど、金融工学のようなそうではない(恐らくそうではなさそうな)分野でも使われ続けているのはなぜだろうか。 理由の一つは、計算が容易であるということ。 正規分布を仮定すると、美しい解析解が得られる。 このことは回帰分析の過程を追ってみると分かる。 それから、もう一つ。 理解が容易であるということもあるんじゃないだろうか。 エイモス・トバースキーとダニエル・カーネマンによれば、人びとは、自分に理解できない案は、そこに内在する リスク に関係なく「 リスク が大きい」と判断し、理解できる案は、内在する リスク に関係なく「 リスク が小さい」と判断する傾向があるという。 『イノベーションのジレンマ』 よく分からないものには手を出したくないという気持ちは分かる。 でも、「理解できる/できない」と「事実に即している/即していない」とは、何の関係もない。

分類症候群

『ブラック・スワン[上]』 を読んだ。 『ブラック・スワン[下]』 は既に読んでいるけれど、[上]も読んで良かったと思う。 人は何かとパターンを見つけがちだ。 あるいは、ありもしないパターンを作りがちだ。 いい加減な分類がどれだけ傍迷惑か思い知りたければ、分類でできる塊が歴史上どれだけ頻繁に変更されたかを調べればいい。 自分が多少なりとも囓っている分野だとロックとかミステリィは酷い。 これはロックだとかこんなのはミステリィじゃないとか、はた迷惑な議論をそこかしこで見かける。 それでいて、ロックとかミステリィの定義に共通理解はない。 ラフ画にペン入れすると下手になった気分になるのと同じだ。 明確に一線を引かなければ、めいめいが好きな線を選ぶ。 もっと言えば、線なんて見ていない。 いや、何も見ていない。 ミロのヴィーナスが美しいのは、手がないのと同じだ。 なければ、そこに理想のものがあると仮定できる。 面白いのは、多くの場合、理想自体は後にも先にも仮定の中にも存在しないこと。 仮定できるのは、理想のものがあることだ。 理想があることを想像することと、理想自体を想像することは違う。 理想自体を想像できるのは、作り手側に属するときだけだと思う。

Extreme Value Theory

ブラック・スワン[下] を読んだ。 ブラック・スワン[上] は読んでいない。 図書館で両方同時に予約したら、先に[下]が確保されたからだ。 上巻を読んで面白かったら下巻を借りようと思い、上巻だけを予約する人はいても、その逆はいないからだろう。 [上]を待ってから[下]を借り直すのも面倒だったので、読んでしまったけれど、同著者の 『まぐれ―投資家はなぜ、運を実力と勘違いするのか』 を読んでいたせいか、すんなりと入っていけた。 本書では正規分布がこき下ろされている。 それどころか、対数正規分布さえ、「とてもひどい妥協の産物」と切って捨てる。 なぜなら、それらでは黒い白鳥(ブラック・スワン)を正しく扱えず、問題の多くには黒い白鳥が潜んでいるからだ。 統計を囓っている者としては、耳が痛い。 自分の浅薄な考えでは、極値統計学が比較的この手の問題に正直に取り組んでいると思うのだけれど、いかんせん日本語の文献が少ない(というか書籍では絶版本しか知らない。今Amazon.comのマーケットプレイスで\28000)。 洋書を読もうかな……。 (結論が昨日のエントリ 『Mirror House Annex: ヴェランシア第三惑星』 と同じだ!!)

確率・統計の調理法

『運は数学にまかせなさい―確率・統計に学ぶ処世術』 を読んだ。 確率・統計に関する本を何冊(ここ1年で20冊くらい)か読んでいると、トピックが重複していることに気がつく(例えば誕生日問題)。 だからと言って、本書が詰まらないということにはならない。 同じトピックを扱っていても、語り口によって印象は全く異なる。 本書のユーモアを交えたカジュアルな語り口は、確率・統計という敬遠されがちなテーマにも、関心を引き起こしてくれる。 ほとんどのトピックが既知でも、確率・統計をこんな風に調理できるのか、と楽しめた。

思考と統計

『不透明な時代を見抜く「統計思考力」』 を読んだ。 定性的に考えることも重要だけれど、その結論が事実と即していなければ、その結論に基づいた判断がかえって害をもたらすことがある。 結論が事実に即しているかどうか確かめるには、データ(統計)に当たるしかない。 ただし、データにも様々な偏りがあるから、全幅の信頼を置くことはできない。 だから、偏りを意識した上でデータを丁寧に見ることが、事実に即した判断に必要だろう。