فایل‌ اولیه‌ی دادگان آموزش و آزمون را می‌توانید از این لینک دانلود کنید.

کوئرا تصمیم گرفته به جونیورای کوچک که پنج سال داره یاد بده که هر کلمه‌ای که می‌بینه چیه تا بتونه تفاوت یک بیماری با اثر هنری رو یاد بده. اما چون بازار ایجنت ها داغه، تصمیم گرفته که برای این کار یه ایجنتی بنویسه و برای همین نیاز به کمک شما داره. این ایجنت باید فایل زیپ قرار داده شده رو بخونه. این فایل دامپ ستون‌های یک دیتابیسه. و هر ولیوی‌ اون، یک متن رمز شده‌ست.(راهنمایی: این رمزگذاری به عدد ۶۴ علاقه داره) بعد از decode کردن مقادیر رمز شده، باید هر سطر به مدل زبانی مشخص شده، داده بشه و این مقادیر براش توسط مدل زبانی پر بشه:

{
  "تاریخ و زمان": [],
  "مکان جغرافیایی": [],
  "معابر شهری": [],
  "مرکز پزشکی/درمانی": [],
  "مرکز آموزشی": [],
  "مرکز رسانه ای": [],
  "مرکز ترانزیت": [],
  "مرکز فرهنگی/هنری/مذهبی": [],
  "مرکز ورزشی": [],
  "نهاد حکومتی/سیاسی": [],
  "سازمان مالی/تجاری": [],
  "شخص": [],
  "بیماری": [],
  "درصد": [],
  "مقدار پول": [],
  "محصول": [],
  "رویداد/مناسبت": [],
  "عنوان شغلی": [],
  "قومیت/ملیت/مذهب": [],
  "شماره": [],
  "حیوان": [],
  "گیاهان": [],
  "شاخه علمی": [],
  "شاخه ورزشی": [],
  "زبان": [],
  "اثر ادبی/هنری": [],
}

توجه

اگه کنجکاو شدی بدونی چطور متن رو تکه‌تکه می‌کنن و اسامی مهم رو میکشن بیرون، فقط سه تا حرف رو سرچ کن: NER

سپس به همه‌ی این خروجی‌هایی که از مدل زبانی گرفته شده‌ن به ترتیب در فرمت csv سیو بشن. (یعنی در هر سطر این csv، یک جیسون پرشده به فرمت بالا وجود خواهد داشت.)

نحوه ارسال پاسخ

برای این سوال یک فایل result.zip ارسال کنید که شامل موارد زیر است:

  1. submission.csv: خروجی مدل شما با یک ستون:
    • gold
  2. solution.py: کد کامل شامل پیش‌پردازش، آموزش مدل، و تولید خروجی.

امتیازگیری:
تعداد دیتاها ۵۵ تاست. و ماکسیمم امتیاز سوال ۱۰۰ تا. اسکور F1 برای پاسختون محاسبه می‌شه و به میزان این اسکور، امتیاز دریافت می‌کنید. (بنابرین ماکسیمم امتیاز ممکن برای دریافت، ۱۰۰ هستش.)
F1 = 2 * (precision * recall) / (precision + recall)

توجه

کدهای ارسال شده دستی تست می‌شن. به این صورت که فایل زیپ قرار داده شده در کنارشون(یعنی در فولدر یکسانی هستن) رو باید بخونه و خروجی csv رو کامل همون‌جا سیو کنه. (پس دقت کنید که ایجنت باید تمام دیتاست رو یک‌جا بخونه و دیتاش رو پراسس کنه. (یعنی به ازای هر سطر، پراسس جداگانه نداشته باشیم.))

توجه

برای استفاده از مدل زبانی مجاز(یعنی Llama 3.3 70B) می‌تونید از اینجا پیش برید.

ارسال پاسخ برای این سؤال
فایلی انتخاب نشده است.