Rで何かをしたり、読書をするブログ

政府統計の総合窓口のデータや、OECDやUCIやのデータを使って、Rの練習をしています。ときどき、読書記録も載せています。

2026-01-01から1年間の記事一覧

UCI Machine Learning Repository の Obesity データの分析9 - 決定木モデルで予測。正解率は 94.2%

www.crosshyou.info 今回は決定木モデルで予測します。decision_tree() 関数で、エンジンは rpart を使います。モデルを作成します。 ワークフローを作ります。 チューニンググリッドを作成します。 チューニングを実行します。 最適なパラメータを取り出し…

UCI Machine Learning Repository の Obesity データの分析8 - Quadratic Discriminant Analysis で分類。正解率は 56.4%

www.crosshyou.info の続きです。今回は、Quadratic Discriminant Analysis で分類してみたいと思います。 モデルを作成します。discrim_quad() でエンジンは MASS です。 次はワークフローの作成です。 トレーニング用のデータで学習します。 あれれ、エラ…

読書記録 - 「名水と日本人 起源から百名水まで文化と科学でひもとく」 鈴木 康久, 河野 忠 著 (中公新書)

名水と日本人 起源から百名水まで、文化と科学でひもとく (中公新書) 作者:鈴木康久,河野忠 中央公論新社 Amazon 本書の「はじめに」に「多くの人々が集う場でもある名水。その魅力を問い直すことは水と日本人の関係を知ることにつながる。暮らしが求め、時…

UCI Machine Learning Repository の Obesity データの分析7 - multinomial logistic regression での予測。正解率は 90.1%

www.crosshyou.info 今回は、glmnet エンジンで multinomial logistic regression でやってみます。 モデルを作成します。multinom_reg() 関数です。 ワークフローを作成します。 チューニングのグリッドを作成します。 チューニングを実行します。 最良のパ…

UCI Machine Learning Repository の Obesity データの分析6 - Naive Bayes による分類。正解率は 48.2%

www.crosshyou.info 前回は k-NN で予測しました。今回は Naive Bayes で予測してみます。 はじめに discrim パッケージを読み込んでおきます。 モデルを作成します。 ワークフローを作成します。レシピは前回の k-NN で作成したレシピをそのまま使います。 …

UCI Machine Learning Repository の Obesity データの分析5 - k-NNによる分類。正解率は 87.6%

www.crosshyou.info の続きです。今回からはいよいよ実際の分類をしていきます。今回は、k-NN で分類してみます。 tidymodelsパッケージのワークフローに沿って実行します。 まず、tidymodelsパッケージを読み込んでおきます。 次は、トレーニング用のデータ…

読書記録 - 「輝石の空 <破壊された地球> 三部作」 N. K. ジェミシン 著 (創元SF文庫)

輝石の空 〈破壊された地球〉三部作 (創元SF文庫) 作者:N・K・ジェミシン 東京創元社 Amazon <破壊された地球>三部作の第3作目です。 エッスンとその娘、ナッスンの話が交互に語られ、母子は地球の反対側のコアポイントに向かいます。母と娘の葛藤が軸かと…

UCI Machine Learning Repository の Obesity データの分析4 - 探索的データ分析: EDA (Exploratory Data Analysis) の実践その3

www.crosshyou.info の続きです、前々回、前回に続き、探索的データ分析: EDA (Exploratory Data Analysis) をしていきます。 obesity と CH2O です。How much water do you drink daily? という質問なので、水を一日にどれくらい飲むか? です。 normal wei…

UCI Machine Learning Repository の Obesity データの分析3 - 探索的データ分析: EDA (Exploratory Data Analysis) の実践その2

www.crosshyou.info の続きです。 今回も前回に続き、探索的データ分析 (Exploratory Data Analysis) をします。 obesity と FHWO(Family History With Overweight) です。家族に肥満の人がいるかどうかです。 obesity の人、overweight の人はほとんど家族…

UCI Machine Learning Repository の Obesity データの分析2 - 探索的データ分析: EDA (Exploratory Data Analysis) の実践その1

www.crosshyou.info の続きです。今回は 探索的データ分析: EDA (Exploratory Data Analysis) という作業をしていきます。このデータの目的は、obesity の7つのカテゴリーを予測する、ということですから、obesity と他の変数の関係性を調べようと思います。…

UCI Machine Learning Repository の Obesity データの分析1 - CSVファイルのデータをRに読み込ませる。

今回からしばらくは、UCI Machine Learning Repository の Obesity(肥満)のデータを使ってみたいと思います。 Estimation of Obesity Levels Based On Eating Habits and Physical Condition [Dataset]. (2019). UCI Machine Learning Repository. https://d…

都道府県別の定期健康診断結果報告のデータの分析7 - 勾配ブースティングモデルでの回帰分析

www.crosshyou.info の続きです。今回は勾配ブースティングモデルで所見率を回帰分析してみます。 xgboost パッケージを読み込みます。 説明変数(per_jushin, log_place, log_jushin)を行列に変換します。 shokenritsu を被説明変数として取り出します。 XGB…

読書記録 - 「オベリスクの門 <破壊された地球> 三部作」 N. K. ジェミシン 著 (創元SF文庫)

オベリスクの門 〈破壊された地球〉三部作 (創元SF文庫) 作者:N・K・ジェミシン 東京創元社 Amazon <破壊された地球>三部作の第2作目です。 前作は、エッスン、アマダ、サイアナイトの三人の話が交互に語られるという話でしたが、今作はエッスンとその娘の…

都道府県別の定期健康診断結果報告のデータの分析6 - 決定木モデルでの回帰分析

www.crosshyou.info の続きです。前回は lm() 関数を使って、線形モデルで重回帰分析をしました。R-squared は 0.22 ということで残念ながら線形モデルでは、所見率は上手く説明できないようでした。そこで今回は決定木モデルを使ってみます。 はじめに rpar…

都道府県別の定期健康診断結果報告のデータの分析5 - 所見率を被説明変数にして重回帰分析をする。

www.crosshyou.info の続きです。今回は、shokenritsu: 所見率を被説明変数にして重回帰分析をしてみたいと思います。 まずはじめに、per_jushin: 1事業所当たりの受診者数の数、log_place: 事業所の数の対数変換値、log_jushin: 受信者数の対数変換値を説明…

読書記録 - 「第五の季節 <破壊された地球> 三部作」N. K. ジェミシン 著 (創元SF文庫)

第五の季節 〈破壊された地球〉三部作 (創元SF文庫) 作者:N・K・ジェミシン 東京創元社 Amazon <破壊された地球>三部作の第1作目です。 この三部作で3年連続してヒューゴー賞を受賞したということで、期待をもって読み始めました。読み終わった感想は、…

都道府県別の定期健康診断結果報告のデータの分析4 - 地理的な位置関係との関連を分析

www.crosshyou.info の続きです。前回は、2017年と2015年の所見率に違いがある、1事業所当たりの受診者数に違いがある、所見率の差と1事業所当たりの受診者数の差には関連はなさそう、ということがわかりました。 今回は、所見率の増減や、1事業所当たりの受…

都道県別の定期健康診断結果報告のデータの分析3 - 2015年と2017年の所見率、1事業所当たりの受診者数の比較

www.crosshyou.info の続きです。前回のグラフで、shokenritsu: 所見率と per_jushin: 1事業所当たりの受診者数は2015年と2017年で若干の差があるように見えました。今回はもう少し詳しく調べてみます。 t.test() 関数で2015年の shokenritsu と2017年の sho…

読書記録 - 「グローバル格差を生きる人びと 「国際協力」のディストピア」 友松 夕香 著 (岩波新書)

グローバル格差を生きる人びと 「国際協力」のディストピア (岩波新書) 作者:友松 夕香 岩波書店 Amazon 作者の友松夕香さんは2003年、JICAの協力隊員として西アフリカのブルキナファソに赴任し、その後は研究者としてずっとアフリカ大陸の研究を続けている…

都道府県別の定期健康診断結果報告のデータの分析2 - R で箱ひげ図と散布図を描く

www.crosshyou.info の続きです。前回はCSVファイルのデータを R に読み込ませました。今回はグラフを描いて、データの様子がどんなものかを把握します。調査年度によってデータが変わっているかどうかをみたいです。 place: 検診実施事業場数 と year を箱…

都道府県別の定期健康診断結果報告のデータの分析1 - CSV ファイルのデータを R に取り込む

今回からしばらくは、都道府県別の定期健康診断結果報告のデータの分析をしてみます。データは、政府統計の総合窓口、e-stat から取得しました。 ダウンロードした CSV ファイルは下のようなものです。 12行目に変数名を挿入しました。 R でデータを分析しま…

読書記録 - 「読む技法 詩から法律まで、理論的に正しく理解する」 伊藤 氏貴 著 (中公新書)

読む技法 詩から法律まで、論理的に正しく理解する (中公新書) 作者:伊藤氏貴 中央公論新社 Amazon 2025年11月25日が初版で、私が手にしたのは2026年1月20日の3版でした。短い間に版を重ねているので、売れている本だと思います。そのとおりで、読んでいてと…

UCI Machine Learning Repository の Spambase のデータの分析3 - Random Forest で分類

www.crosshyou.info の続きです。今回はランダムフォレストで分類してみます。 今回も tidymodels のワークフローでやります。 recipe() 関数でレシピを作成します。 ランダムフォレストのモデルは、rand_forest() 関数で作ります。 レシピとモデルを統合し…

UCI Machine Learning Repository の Spambase のデータの分析2 - Elastic-Net Logistic Regression で分類する。

www.crosshyou.info の続きです。前回は首尾よくデータのテキストファイルを R に読み込ませることができました。今回からは、いろいろなモデルで分類していきます。いちばんはじめはロジスティック回帰です。L1 + L2 の正則化の Elastic-Net Logistic Regre…

UCI Machie Learning Repository の Spambase のデータの分析1 - テキストファイルのデータを R に読み込む。

今回からしばらくは、UCI Machine Learning RepositoryにあるSpambaseのデータセットで分類の練習をしてみたいと思います。 Hopkins, M., Reeber, E., Forman, G., & Suermondt, J. (1999). Spambase [Dataset]. UCI Machine Learning Repository.https://do…

読書記録 - 「英検1級 文で覚える単熟語 4訂版 (音声DL付)」 旺文社

英検1級 文で覚える単熟語 4訂版(音声DL付) 英検文で覚える単熟語 旺文社 Amazon 目指せ英検1級!と意気込んで買ってはみたものの、そうそうに英検合格はあきらめ、純粋に文章を読んで楽しむ本となりました。なので、この本が英検1級にどれだけ役に立つか…

日銀が保有する国債残高のデータの分析6 - Rで機械学習 - 3人寄れば文殊の知恵 - Elastic-Net, k-NN, ランダムフォレストの三つの多数決で正解率が向上

www.crosshyou.info の続きです。今回はランダムフォレストで分類してみます。 レシピを作成して、rand_forest()でエンジンをrangerにしてランダムフォレストモデルを作ります。 ワークフロー作成、クロスバリデーションの設定、チューングリッドの作成をし…

日銀が保有する国債残高のデータの分析5 - Rで機械学習 - tidymodelsでkknnエンジンで分類 - 正解率は92%

www.crosshyou.info の続きです。前回は glmnet で elastic-lasso でtypeを分類してみました。今回は kknn でk-NN で分類してみます。今回も tidymodels パッケージのワークフローで分類しますので、おおまかな流れは同じです。 まず、レシピ を作成します。…

日銀が保有する国債残高のデータの分析4 - Rで機械学習 - tidymodelsでglmnetエンジンでtypeの分類 - 92%の正解率

www.crosshyou.info の続きです。前回はRでt検定とANOVAをやりました。今回は機械学習でtype: 5年債とか10年債とかを分類してみましょう。 その前に、一応の確認として、seriesとtypeの関係をグラフで見ておきます。 seriesの分布をヒストグラムにします。 s…

日銀が保有する国債残高のデータの分析3 - Rでt検定とANOVA - 年の違いは無い、種類別の違いはある。

www.crosshyou.info の続きです。前回は日銀の保有する国債の残高についてグラフでどのようなデータかを確認しました。その結果、国債1つ1つの保有残高の平均値は2025年3月10日と2026年3月10日で大きな変化は無いこと、国債の種類別の平均値は大きな違いがあ…