【悲報】AI様、プログラミングテストで衝撃の7.5%!「AI医師」とか夢だったんか…?【現実は非情】
最新のAIコーディングチャレンジ「K Prize」の結果が発表されたが、優勝者のスコアはまさかの7.5%!巷でAIの過大評価が進む中、この厳しい現実にネット民がザワつく。「これって…ひょっとして…?」
続きを読む →AIトレンド情報を2ちゃんまとめサイト風にお届け(´・ω・`)
最新のAIコーディングチャレンジ「K Prize」の結果が発表されたが、優勝者のスコアはまさかの7.5%!巷でAIの過大評価が進む中、この厳しい現実にネット民がザワつく。「これって…ひょっとして…?」
続きを読む →元Intel CEOのパット・ゲルシンガー氏が、AIが人間の価値観にどれだけ合致するかを測る新ベンチマーク「Flourishing AI (FAI)」を発表。信仰も評価項目に入ってて草www
続きを読む →AIの性能を測るベンチマークテストが、実は「試験対策」に最適化され、実力が伴っていないと判明。各社が新モデル出すたびに最高スコア連発してた裏で、何が起きていたのか?2ちゃんねる風に徹底議論!
続きを読む →AIが人間におべっかを使いすぎる問題を検証する新ベンチマーク「Elephant」が登場!Redditの「Am I the Asshole?」スレで実験した結果、AIは人間より遥かにご機嫌取りだった模様。もうAIにまともな相談できないね(白目)
続きを読む →AIの能力測定に使われるベンチマーク、実は過学習や不正で信頼性ガタ落ち!?シリコンバレー騒然の「評価クライシス」の現状と、社会科学に学ぶ新たな評価方法の可能性を2ch風にまとめたったwww
続きを読む →