Home
Language
English
Türkçe
Bahasa Indonesia
About
Privacy Policy
Terms of Service
Pricing
Sign In
Download All
Share
Shota Sato
@Shota_Sato01
Master’s student at Komachi Lab @Hitotsubashi_U | NII Research Assistant | Working on NLP, Vision and Language, LLM Safety
Joined October 2024
381
Following
270
Followers
346
Posts
Pinned Tweet
Shota Sato
@Shota_Sato01
23 days ago
原因がよくわかってないんですが、私のXのDMが見れない状態になっています。。 通知は見えるのでメッセージを送ってくださったこと自体はわかるのですが、内容が見れない&こちらから送信もできない状態です、、 もしよければ個人ページのメールアドレスに改めて送ってください🙇
Shota_Sato01
retweeted
須山敦志 Suyama Atsushi
@sammy_suyama
about 16 hours ago
強化学習の多様性を「報酬の不確実性への合理的な応答」とする手法。性能を犠牲にせず、LLM推論などで多様かつ適応的な行動を引き出せることを示した。「目的をよく知らない」が多様性や安全性につながる Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning https://t.co/XRX6uZsOhb
Shota_Sato01
retweeted
iwashi / Yoshimasa Iwase
@iwashi86
1 day ago
このサイト知らなかったな。眺めているだけでも面白いのと、各用語をclickすると説明ページに飛べるのも親切だ。 "LLM Architecture Gallery" https://t.co/Lrt0aW11ff
Shota_Sato01
retweeted
Shuta Kobayashi 小林秀太
@ShidAreTree63
2 days ago
新しい論文を公開しました! 「ニューラルネットワークは、どのような情報を、どのような速度で獲得するのか?」 本研究では、学習ダイナミクスを確率過程として記述し、Fisher情報量から情報獲得の速度限界を導きました。 ちなみに初主著になります! https://t.co/vYbnuK3EEs
Shota_Sato01
retweeted
Kazunori Sato
@kazunori_279
4 days ago
同じモデルでコーダーとレビュアーの2セッションを走らせ、gh issueを介して人が介在しないループを回してみたら、確かに作業の密度は上がるのだけど、レビュアー君がどんどんミクロな問題を掘り下げていって新しいissue作りまくって収集がつかなくなった。しまいには他人のリポジトリにPR投げようとする。 AIがいまどんな問題にどんな方法で取り組んでいるかを人が理解した上で「そこまでやらなくていい」「こっちを先にやって」と仕切らないと、自分たちで無限に新しい仕事を生み出してトークン消費マシンと化してしまう。この現象って名前ついてる?
Shota_Sato01
retweeted
やの
@yano0_c
3 days ago
EMNLP26に現地参加する人達と交流するためのdiscord作ったので参加される方はよければ! https://t.co/LvseUGZf7u
Shota_Sato01
retweeted
YANS🌱言語処理若手シンポジウム
@yans_official
4 days ago
#YANS2026
の開催報告記事を公開しました! ご参加いただいた皆様,ご支援いただいた皆様,どうもありがとうございました🌱 https://t.co/VexLS2L1SI
Shota_Sato01
retweeted
ZOZO Developers
@zozotech
10 days ago
【ZOZO TECH BLOG】最新号 「日本語CLIPを活用した検索ランキング学習の精度改善検証」 https://t.co/Wdb1nRLE27 検索ランキング学習に画像の情報をどう取り込む?日本語CLIPの類似度を特徴量に加えてnDCG最大約0.7%改善、SHAPで要因を分析した検証記事です
#zozo_engineer
Shota_Sato01
retweeted
fly51fly
@fly51fly
9 days ago
[LG] How Do Language Models Choose Between Context and Memory? B Shih, J Winnicki, A Cao [Stanford University] (2026) https://t.co/bIPNys2AGC
Shota_Sato01
retweeted
Shiro Takagi
@takagi_shiro
9 days ago
2018年から2026年までのICLRの査読の推論をLLMに分析してもらってサイトとして公開しました! スコアではなく、何を見て、どの基準に照らして、どう結論したかを見ようとしてます。 中身は英語ですが、図を眺めるだけでも是非〜! https://t.co/Q43XtwjUfy
Shota_Sato01
retweeted
論計舎
@ronkeisha_info
10 days ago
LLMは誤った証明を生成しながら、同じ推論を個別に検証すると正しく棄却する——「認識論的不安定性」と命名された現象。個々のステップは正確でも大局的な組合せ推論が未解決。形式証明ベンチマークProofGridの発見。 https://t.co/BI6FNIFEIQ
#形式検証
#生成AI
https://t.co/BI6FNIFEIQ
Shota Sato
@Shota_Sato01
9 days ago
こちらの論文をarXivで公開しました! CLIPのモダリティギャップを縮めたときに関する分析を色々やってます! https://t.co/5YZXthANb2
Shota Sato
@Shota_Sato01
21 days ago
主著論文がEMNLPのmainに採択されました!! 共著者の皆様、査読に関わってくださった皆様、ありがとうございます!
Shota_Sato01
retweeted
Daisuke Okanohara / 岡野原 大輔
@hillbig
10 days ago
NoRAはLoRAのdown-projectionを正規化し、学習速度・安定性・性能を大きく改善する。 LoRAでは、ファインチューニング時に元の重みWに対して低ランクな更新 ΔW = αBA を加える。ここでAはr×k、Bはd×rの行列であり、rは元の入出力次元よりかなり小さい。 標準的なLoRAでは、Aをランダムに、Bを0に初期化してから学習する。B=0という性質のため、学習初期のLoRAの挙動はほぼAによって決まる。 フルファインチューニングにおける重み勾配を G = ∂L/∂W とすると、初期状態では ∂L/∂B = αGA^T 学習率をηとすると、重みの変化幅は ΔB = -ηαGA^T また、初期状態ではB=0なので、 ∂L/∂A = 0 となり、最初の更新ではAは動かない。 したがって、LoRAによって実際の重みWに生じる変化は ΔW = αΔBA = -ηα^2GA^T A となる。 ここで P = α^2A^T A と置けば、 ΔW = -ηGP と書ける。NoRAという手法そのもの以上に、この式によるLoRAの解釈が重要。 もともとフルファインチューニングでは ΔW = -ηG なので、LoRAは少なくとも学習初期において、勾配に P = α^2A^T A というpreconditionerを掛けた更新とみなせる。 このとき、Aの各列のノルムは、各入力方向に対する実効的な学習率として働き、Aの第j列をa_jとすると、そのスケールは α^2 ||a_j||^2 となる。 標準LoRAのランダム初期化では、この値が入力方向ごとにばらつくだけでなく、全体として小さくなりやすい。そのため、LoRAの初期gradient normはフルファインチューニングよりかなり小さくなる。 そこでNoRAでは、Aの各列のノルムが1になるように正規化する。 a_j <- a_j / ||a_j|| これにより、入力方向ごとの不要なスケールのばらつきをなくし、LoRAの初期gradient normをフルファインチューニングに近づけることができる。 しかも、この正規化は学習中ずっと続けなくてよく、初期化時に一度だけAを正規化するNoRA-initでも、NoRAによる性能改善の大部分を得られる。 さらに、Aを A = [I_r, I_r, ..., I_r] このようなブロック単位の単位行列で初期化するBIMI(Block Identity Matrix Initialization)でも、NoRA-initとほぼ同等の性能を達成できる。 これは、初期化分布そのものよりも、Aの各列のノルムを揃えることが重要であることを示唆している。 コメント === 2層の線形層を重ねて勾配降下法で学習すると、特異値・特異ベクトルに沿った学習ダイナミクスが現れることが知られている(Saxe et al., 2014)。 この場合、今回のNoRAが注目している学習初期だけでなく、学習が進むにつれて大きな特異モードから速く学習されるという現象が現れる。 また、W = BA としたとき、Wに対する更新は概念的には -BB^T G - GA^T A という形になり、左右両側からのpreconditioningを暗黙に生み出す。 LoRAでは初期値がB = 0なので、学習開始時には左側のBB^T Gの項が消え、 -GA^T A という右側からのpreconditioningだけが残る。今回のNoRAは、特にこの初期段階に注目したものと見ることができる。 2つの線形変換を連続して適用する構造はLoRAだけでなく、Transformerを含むニューラルネットワークのさまざまな場所に現れる。その最適化ダイナミクスに対しての基本的な理解が重要となっている。
See More
Shota_Sato01
retweeted
Claude
@claudeai
10 days ago
We’re introducing Claude Fable 5.1 and Claude Mythos 5.1. They're the world’s most advanced models for coding and knowledge work.
claudeai's tweet video.
Shota_Sato01
retweeted
ぷしゅ
@bunvunm
10 days ago
正規化の気運が個人的に高まっている(初期化の調整だけでいい気もするが) https://t.co/lZkkiPAAk5
Shota_Sato01
retweeted
Mamoru B Komachi
@mamoruk
10 days ago
今日の午前中の進捗報告、新しいテーマについて相談したい、と言うので、前回? 前々回? 話に出ていた「新しいテーマ」かと思いきや、完全に新しいテーマであり、しかも主要な実験が既に終わっており、さらに論文まで書けている(大体全体が埋まっている)ということで、びっくりした。
Shota_Sato01
retweeted
LLM勉強会(LLM-jp)
@llm_jp
10 days ago
LLM-jpは、国産LLM「llm-jp-4-8b-thinking」をマルチモーダル化した視覚言語モデル「LLM-jp-4-VL 9B」を公開しました。 https://t.co/b64qaHjwdc
Shota_Sato01
retweeted
わたおか『生成AIの安全性入門』出版🎉
@Wataoka_Koki
10 days ago
EMNLP'26にて採択された論文のプロジェクトページを公開しました! https://t.co/hlHgSzoCjW VLMは入力チャネルが2つあるのに対し、共通する倫理的判断はどう処理されるのか?という観点に注目し、ニューロンレベルでの分析を行った研究です!
Shota_Sato01
retweeted
Daisuke Okanohara / 岡野原 大輔
@hillbig
11 days ago
LLMの専門データは、ファインチューニングまで取っておくより、事前学習の段階から少量ずつ混ぜた方が有効であると報告されている。 専門データを事前学習中に1〜5%程度混ぜ、さらに同じデータでファインチューニングする。これをSpecialized Pretraining (SPT)とよんでいる。 化学、音楽、数学の3領域で、通常のファインチューニングよりも専門性能が向上し、さらに一般能力の忘却も減った。1BのSPTモデルが3Bの通常モデルを上回る結果が得られた。 専門データを事前学習中に数十回繰り返したとしても一般データと混ざるため過学習しにくく、さらに事前学習中に、専門データに対する損失も下がっているため、専門データでファインチューニングする際、パラメータが大きく変わらず、一般能力の忘却は減りにくい。 コメント === 事前学習データ中に、少しでもデータを見せておくと、事後学習に上げやすいという話はすでにあったが今回の話はさらに、そうしたデータは何回見せても、割合としては少ないから過学習しやすく、さらにファインチューニング時の能力は下がりにくいという話である 十分小さいモデルでたくさん使うのであれば、専用モデルを一から学習してもコスト的に割に合うようになるかもしれない
See More
Shota_Sato01
retweeted
sho_yokoi
@sho_yokoi
11 days ago
最先端 NLP 勉強会で用いたスライドです。 Karkada さんの論文 × 2本で、いずれも言語の表現空間の幾何に関するものです。この手の話題を形式的に議論するためのフレームワーク自体をアップデートする快作で、私的・年間 best papers でした。 https://t.co/sEdY6kEynv
Shota_Sato01
retweeted
Goro Kobayashi
@goro_koba
12 days ago
最先端NLP勉強会で論文紹介しました! スライド:https://t.co/FGTYiCFgRm
Last Seen Users on Sotwe
The Dirty Rainbow
Seen from
Germany
Sikatterus
Seen from
Indonesia
media kreatif lokal
Seen from
Indonesia
Akın DURUCU
Seen from
Turkey
Bến tre
Seen from
Vietnam
Naked Downunder - Australian naturists
Seen from
Turkey
RUBEN HERNANDEZ
Seen from
United States
Durlendir69
Seen from
Indonesia
Kha
Seen from
Vietnam
Pamela TRANSX
Seen from
Spain
Trends for you
1
#NeverForget
Under 10K tweets
2
#911Remembrance
Under 10K tweets
3
Pentagon
Under 10K tweets
4
Gayle King
Under 10K tweets
5
Jhene
Under 10K tweets
6
World Trade Center
Under 10K tweets
7
#PatriotDay
Under 10K tweets
8
#HappyBirthdayRM
Under 10K tweets
9
Flight 93
Under 10K tweets
10
Saudi Arabia
Under 10K tweets
Most Popular Users
1
Elon Musk
@elonmusk
241.6M followers
2
Barack Obama
@barackobama
119M followers
3
Cristiano Ronaldo
@cristiano
114.2M followers
4
Donald J. Trump
@realdonaldtrump
111.8M followers
5
Narendra Modi
@narendramodi
107.2M followers
6
Rihanna
@rihanna
98.7M followers
7
NASA
@nasa
92.4M followers
8
Justin Bieber
@justinbieber
91.8M followers
9
KATY PERRY
@katyperry
89.9M followers
10
Taylor Swift
@taylorswift13
83.8M followers
11
Lady Gaga
@ladygaga
75.3M followers
12
Virat Kohli
@imvkohli
73.2M followers
13
Kim Kardashian
@kimkardashian
70.8M followers
14
YouTube
@youtube
68.8M followers
15
Neymar Jr
@neymarjr
66.2M followers
16
Bill Gates
@billgates
65M followers
17
Selena Gomez
@selenagomez
63M followers
18
The Ellen Show
@theellenshow
62.3M followers
19
CNN
@cnn
61.8M followers
20
X
@x
60.7M followers
Olivia
Online
✨
⭐
💫