無名プログラマー。(マジなのでできれば見てやってます。 バイブコーディングをメインにしています。(ご理解のほどお願い致します) 多分フォロバする

Github, Hugging Face, Zenn, X
Spark-X2.5-4B を日本語化しました。 Qwen3.8-27B から蒸留して ・中国語の混入 18%→0% ・日本語の自然さ 2.09→3.81(Qwen3.5-4B は3.32) ・一般常識 23→27/30問 ブラウザで試せます project.arils.jp/Spark (Web推論なので熱くなります) 数学(AIME 2026)の結果ももうすぐ出します
2
15
126
13,066
このベンチが有名になりすぎて 更新がされてないモデルだと間違えてそう 性能というかこういう問題はあるから戦車は車が必要ということを暗記してる的な (間違ってるかもしれない……でも多少は影響はあるんじゃないかな)
Gemini 3.5 Flash-LiteとGPT-5.6 Luna、Claude Sonnet 5.5、Apple IntelligenceのオンデバイスAIとクラウドで例の質問を比較してみた
1
5
1,175
昨日から9Bの学習を回してるから評価してるけど、多分OxCoder-9Bの方が高性能(IFEvalみたいな指示追従性はNeoHorse-1 9Bの方が高い) ただ、OxCoder-9Bは正式にFable 5.1の回答を蒸留したものと書いてあるからAnthropic的な思想に基づいてクリーンな方を選んだ……
なぜか誰も話題にしていないOxCoder-9B。ベンチマークではOrnith1.5-9Bを超えている。Neohorse-9Bとどっちがいいんだろうなぁ! huggingface.co/OrionLLM/OxCo…
1
2
32
1,949
OxCoderの方高性能まじか!
1
2
134
極端には変わらんとは思う(コードだけ使うガチ勢はOxCoder-9Bの方が少しいい気はする)
2
117
何これ、こんなの初めてみたんだけど どうしたのChatGPT
2
2
132
どんだけ話したんだ…… まあコンテキストが上限に達した時に出るやつ
45
atemoya retweeted
AI 🤏 SI 🚀
1
4
8
347
Ornithこそが私たちのヒーローです
This is bad news. Looks like Qwen will not be releasing 35B for next release. Not cool Qwen, not cool. We have a huge user base waiting for just this, what most users have is low end cards, this is the largest user base, how can you abandon it. please release something for us if 35B is not coming.
1
10
608
結局こいつらのベースを作ってるQwen 3.5 9Bはガチで偉大 ローカルLLMを進めた企業といえばQwenだと思ってる
1
3
93
atemoya retweeted
クリエイターとして、自作ではないと言うのは超えてはならないラインだと思う。 価値を作るのがクリエイターであって、自作をするからこそ価値が生まれる。 誤解を招いた所は訂正もするし謝罪もするが、自作を撤回するつもりは無い。
4
1
15
2,322
この時代にブラクラ引っかかってる人いてほんま嬉しい
クソすぎる。エロサイト開いたらSafariぶっ壊れてもうたわ、対処法求む
1
1
9
7,586
2026年でもブラクラって動くんやな......(白目)
2
197
もっと伸びていいだろこのモデル(OxCoder-9Bも含めて) どうしてXはこういうモデルを出してくれないんだ...... (作者の方に一言......頑張ってください!)
1
5
41
4,776
ブログサイト作りました。 project.arils.jp/blog 今の所Apple製品から見るのが一番綺麗に見れると思います......(OSによってUIが変わる)
1
6
1,286
ちなみにこれだけでなんのサイトを元にしたかわかった人はAIサイトをみすぎてると思います。
148
おお
1
1
18
677
昨日出した0.8Bモデルの強化版です。 1億トークンのWikipediaの記事、DPOを行い、より自然な日本語と知識量の向上を行いました。 project.arils.jp/local 0.8Bで多少しか変わってないと感じるかもしれませんが、今後は目に見えるような改善をしていこうと思っているので今後も応援して欲しいです!
2
12
77
3,174
0.8Bで知識側を厚くしていく進め方、気になります。手元では小さめモデルほど固有名詞の呼び出しに弱い感触があって、強化ポイントの優先順位はどう決めていますか?
1
1
54
そうですね……固有名詞は自分もかなり弱点だと感じていて、単純に知識量を増やすだけだと他の能力との取り合いになりやすいので、どこまで入れるかはまだ試行錯誤中です!(RAG強化も含めてやってます!) 今はまず理系寄りを強化して、どの程度まで0.8Bに詰められるか見ています。
17
5分の1万バズ
やったーーみんなも720円払おうぜマジでGoogleAIPro最強だは
1
7
927
Google AI Proって720円だっけ......? でもColabついてくるから意外といけてる(Gemini自体は誰も使ってくれない)
87
だから学習データは全て、どんな早いでも、どんなベンチマークに強いでも、学習データがバイアスがあったらもう使い物にならない。ほぼ全ての中国製モデルこの問題がある。 ←Takenoko12345678/Qwen3.5-0.8B-Japanese-SFT →HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
予告より早いですが、0.8Bの日本語モデルを公開しました。 Qwen3.5-0.8Bから、日本語の常識問題41.7%→69.4%で、GPUなしのPCでも1回1秒前後で返ってきます。 学習データも全部公開済みです。 ブラウザ推論はこちらから(プライベートモードでは使用できないみたいです。) project.arils.jp/local
1
1
2
195
atemoya retweeted
自作のAIチャット。 Geminiより速報に強いです。 検索も、Geminiと違って確実にします。
53
46
726
823,110
すごいし、UIも含めて日本語圏には親しみやすくていいと思うんだけど、 Gemini 3.5 Flash Liteを使ってるからGeminiと比較するのはいただけないかもしれない...... でも今後も頑張ってください!
自作のAIチャット。 Geminiより速報に強いです。 検索も、Geminiと違って確実にします。
1
5
2,915
面白そうなアーティファクチャ思いついた(似たやつはかなりある) 次のQwen 3.5 0.8B Scienceでは使おう......(精度は要チェックだから絶対使うとは言えないんだけれども......)
1
6
721
2000トークンで32000トークンを上限にした際の元のQwen 3.5 0.8Bとほぼ同じスコアを出せるようになったので、ここからさらにどう知識を増やすか、みたいな感じですね 楽しみに待っていただけると嬉しいです!
2
135