778a0a's microblog

logs about gamedev

ファインチューニングモデルだと、データの傾向に従って長い出力をするようになったけど、後半部分がかなり怪しい感じになっている。対策としてデータのバリアンスを増やすのもありかもだけど、LoRA系の手法の限界もあるのかもしれない。

データのバリアンスを増やすという意味で、ちょうど最近見たこれが印象に残った。 https://www.itmedia.co.jp/aiplus/articles/2408/29/news078.html

ITmedia AI�{
����AI�Ɂu���v�������遨�g�ߊw�K�h��h���@�u�l�Ԃ����i�����f�[�^�j�����闝�R���������H�v�@�Č����҂�21�N�ɒ� �ă^�t�c��w�ɏ�������G���b�N�E�z�G�������2021�N�ɁA�����ߊw�K�i�I�[�o�[�t�B�b�e�B���O�j�������������i�ł���ƒ�Ă��������񍐂𔭕\�����B

文字化け

image.png

ついでに外部リンクは_blankにしたい

https://zenn.dev/matsuolab/articles/377f7ae8b1169e

Tanukiモデルの開発において、事後学習は非常に重要な役割を果たしました。この段階では、モデルが人間と自然かつ効果的に対話できるよう、細かな調整を行いました。主に用いた手法は、Supervised Fine-Tuning (SFT)とDirect Preference Optimization (DPO)です。

_blank化はできた。

拡大画像