うおおおおメルカリのデータセットだ、デカすぎんだろ!!!!
> 商品データ,コメントデータはCSV形式で,サイズはそれぞれ約100GB,約40GBです。画像データはサムネイル画像で約2TB,オリジナル画像で約1TBです。
nii.ac.jp/dsc/idr/mercar
hpp
hpp
20.7K posts
hpp
@hpp_ricecake
hpp’s posts
我慢できなくて見てしまった、やばすぎる、Ph.D.レベル(バズワード)と言えるレベル
Quote
hpp
@hpp_ricecake
我慢できなくなってしまったのでChatGPT proプラン課金した、研究のサーベイの依頼をいくつか投げたので寝たら確認する!楽しみ〜
めちゃくちゃ面白かった、最近の自然言語処理に至るまでの道のりが詳細に記述されていて頭が整理された
今更読んだけどクソ面白かった、特にこのページ、順位をone-hotベクトルに変えて最適輸送問題としてみるとランキング学習ができるの最高すぎる
BERTによるテキスト分類のチュートリアルを公開しました!
・ライブドアニュースコーパスを対象とした9値分類
・前処理+主要な評価指標の算出
・実験結果の管理
をモダンな記法・設計で実装しました。
深層学習・NLP初学者の方をはじめ、色々な方の参考になれば嬉しいです!
去年夏インターンで教えてもらったpdb、この1年でどんだけ使ったかわからん
LLMをただの事前学習済み言語モデルとして扱い、微調整にLoRAを利用して、”普通の”テキスト分類を行う実装をGitHubで公開しました。
zero/few-shotではなく、BERTの[CLS]を使うように、普通に分類を文末トークンの埋め込みでやります。
結果としてはかなり強かったです
github.com/hppRC/llm-lora
深層学習の学習待ちにおすすめのVSCode拡張を書く
最推し:
Error Lens
エラーやwarningsがエディタ上にハイライトで表示されるようになる
めちゃくちゃ便利
世のエンジニアの平均がわからん、Twitterを見ている感じエンジニアなら誰でもコンパイラとOSを自作できて青コーダーでトップカンファに論文を通したことがある、という感じがする
10T token以上学習したフルスクラッチな日本語LLMがMITで出たぞおおおおおおおおおおお
ベースモデルと指示チューニング済みのモデルが両方あるぞおおおおおおおおおおおお
特に3Bは3Bと思えない能力があるぜ…ッ
Quote
SB Intuitions
@sbintuitions
日本語に特化した汎用埋め込みモデル 𝗥𝘂𝗿𝗶 を公開しました!
Ruriは
1. LLMを用いた合成データセット作成
2. 大規模な対照事前学習
3. 高品質なラベル付きデータによる学習
の3 stepにより、JMTEBベンチマークにおいて同等規模のモデルを大きく上回る性能を達成しました
今日から株式会社Kotoba Technologies Japanにて、フルタイム正社員として研究開発に取り組みます!!!!!!!
めっちゃ楽しみ、頑張るぞ!!!!!!!!!!!!
(Dも続けます!!!!!!!)
2021夏のITエンジニアインターン情報が集まる魔法のスプレッドシートの管理を引き継ぎました、@kaito_tateyama くんとの共同管理です
誰でも編集できるので、推し企業の情報などドシドシ追加して貰えると嬉しいです
過去のインターン体験記の欄もあるのでそちらもぜひ〜!
#NLP2023 の「日本語Tokenizerの違いは下流タスク性能に影響を与えるか?」が非常に素晴らしかった
tokenizerと辞書の組み合わせ18種類について **事前学習 + fine-tuning** を行い、日本語タスクによる網羅的な評価で形態素解析器の有無による性能差等を明らかにしている
anlp.jp/proceedings/an
日本語テキスト埋め込みモデル 𝗥𝘂𝗿𝗶 のv3を公開しました!
・ベースを日本語ModernBERTに
・系列長が8192へ
・分かち書き器不要
あたりが注目ポイント
JMTEBによる評価では非常に高い性能を達成し、特に310mモデルは平均𝟕𝟕.𝟐と既存SOTAの75.5を大きく上回りました!
日英4.4T tokensで学習した日本語ModernBERTを公開しました!!
系列長8192、語彙数は日英10万、パラメータ数130Mながら既存largeモデルと同等以上の性能があります
12データセットによる既存BERT系モデルの網羅的な評価も行いましたので、そちらもぜひ!!
Quote
SB Intuitions
@sbintuitions
/
130Mパラメータの高性能・長系列対応BERTモデルを公開しました
\
モデルの特徴
・2ヶ月前に公開されたばかりのModernBERTアーキテクチャを採用
・これまでの最良モデルと同水準の性能を1/3のサイズで達成
・一般的なモデルの16倍の長さの文章を処理可能(日本語最長)
詳細はこちら
GitHub Copilotを試してみた。
せっかくなので大学院の課題について文章生成。
見出しと各文の先頭の節「ナップサック問題とは」「これは、」「解法としては、」「今回は」「具体的な手順は、」「1, 2, …」… を入力し、その後ろをCopilotで補完した。
課題やらせてもギリバレない気がするな…
日本語埋め込みモデルRuriのv2を公開しました!!
Ruri-large-v2については、BERT-large規模の日本語埋め込みモデルとしては初めて、OpenAIのtext-embedding-large-v3を超える性能を達成しました
small-v2は70mながらv1のlargeと同等性能です!是非お使いください
ブログを書きました!
先月人生で初めて現地参加した国際学会で、COVID-19に感染しちゃって色々あったぜ、というお話です。
何かの参考になる方がいれば幸いです
argparseの長年の問題を解決する最高ライブラリだ
Quote
モイスツ
@moisutsu
自作のクラスで定義するコマンドラインパーサーclassoptの紹介記事を公開しました
argparseの代わりにこのライブラリを使うと、コマンドライン引数に補完を効かせながら、コーディングを行うことができます
zenn.dev/moisutsu/artic