المجال TRANS-AMT-CD يُستخدم هذا الأمر في برامج COBOL منذ عام 1981. ويُعرّفه إدخال FD على النحو التالي: PIC S9(9)V99 COMP-3حقل رقمي عشري مُعبأ، أحد عشر رقمًا، مع منزلتين عشريتين ضمنيتين. هذه هي البيانات الوصفية التقنية. أما البيانات الوصفية التجارية، أي معنى TRANS-AMT-CD تحديدًا، والعملة المُقوّمة بها، وما إذا كانت المنزلتان العشريتان الضمنيتان تعنيان سنتات أم نقاط أساس، وما إذا كانت القيمة السالبة تُمثل رصيدًا دائنًا أم مدينًا، وكيفية تفسير القيمة الصفرية، فهي غير موجودة في قاعدة البيانات. كانت موجودة في وثيقة مواصفات وظيفية طُبعت عام ١٩٨١، وحُفظت في خزانة ملفات، ولم تُشاهد منذ ذلك الحين. تقاعد المطوران اللذان كانا يعرفان معنى TRANS-AMT-CD في الأصل عام ٢٠١٤.
هذا هو وضع البيانات الوصفية الذي تواجهه كل مؤسسة لديها أنظمة بيانات تمتد لعقود، وهو الوضع الذي لم تُصمم أطر حوكمة البيانات الحديثة لمعالجته. تُعدّ منصات Collibra وAlation وAtlan وغيرها من منصات فهرسة بيانات المؤسسات ممتازة في إدارة البيانات الوصفية للبيانات الموصوفة مسبقًا، وقواعد البيانات السحابية ذات المخططات الموثقة، ومستودعات البيانات ذات دلالات الأعمدة المحددة، ونقاط نهاية واجهة برمجة التطبيقات (API) وفقًا لمواصفات OpenAPI. لكنها غير مصممة لإعادة بناء بيانات وصفية لم تُسجّل رسميًا قط، والتي لا وجود لها إلا في سلوك البرامج التي كُتبت قبل أن تُصبح إدارة البيانات الوصفية تخصصًا قائمًا بذاته، والتي عُدّلت من قِبل عشرات المطورين على مدى أربعة عقود دون أن يُحدّث أحد سجلًا مركزيًا لمعنى كل حقل.
إدارة البيانات الوصفية لأنظمة البيانات الممتدة لعقود ليست هي نفسها إدارة البيانات الوصفية للأنظمة الحديثة. فهي تتطلب منهجاً مختلفاً جذرياً، يبدأ باستخراج البيانات الوصفية من مصادرها الأصلية بدلاً من استيعابها من الأنظمة المتصلة.
ابحث عن المعنى قبل أن يتقاعد
SMART TS XL يستخرج البيانات الوصفية التقنية على مستوى الحقل من إدخالات FD ودفاتر النسخ قبل أن تتمكن أدوات الفهرسة من التحكم بها.
إعرف المزيد…الطبقات الثلاث للبيانات الوصفية القديمة
إن فهم مشكلة البيانات الوصفية في الأنظمة متعددة العقود يتطلب إدراك أن البيانات الوصفية في هذه البيئات موجودة في ثلاث طبقات متميزة، لكل منها قابلية استخراج مختلفة، واكتمال مختلف، وآثار حوكمة مختلفة.
تُعدّ البيانات الوصفية التقنية الطبقة الأكثر قابلية للاستخراج. فهي تصف البنية الفيزيائية للبيانات: أسماء الحقول، وأنواع البيانات، وأطوالها، ومواقعها داخل السجلات، ومواصفات الدقة العددية، والعلاقات بين الحقول ضمن تخطيط السجل. في بيئات COBOL، توجد البيانات الوصفية التقنية في عناصر شفرة المصدر: تُعرّف إدخالات FD تخطيطات السجلات، وتُعرّف عناصر COPY هياكل البيانات القابلة لإعادة الاستخدام، وتُعرّف عبارات SELECT تنظيم الملفات وطرق الوصول إليها، وتُعرّف عبارات JCL DD مجموعات البيانات المرتبطة بكل تنفيذ للبرنامج. هذه الطبقة قابلة للقراءة آليًا من حيث المبدأ، إذ يمكن لمحلل يفهم بنية COBOL استخراجها من شفرة المصدر، ولكنها موزعة على آلاف ملفات المصدر بدلًا من أن تكون مركزية في سجل مخطط.
تصف البيانات الوصفية التشغيلية كيفية انتقال البيانات عبر النظام: أي البرامج تُنتج أي مجموعات بيانات، وأي البرامج تستهلكها، وبأي تسلسل، ومن خلال أي تحويلات. في بيئات الحواسيب المركزية، تُوزَّع البيانات الوصفية التشغيلية عبر مسارات وظائف JCL (التي تُحدد تسلسلات التنفيذ وارتباطات مجموعات البيانات)، ومخططات استدعاء البرامج (التي تُحدد تدفق البيانات بين البرامج)، وتكوين المُجدوِل (الذي يُحدد التوقيت والتبعيات). يُمكن استخراج هذه الطبقة آليًا من الملفات المصدرية، إلا أن الاستخراج يتطلب فهمًا ليس فقط للبرامج الفردية، بل أيضًا للعلاقات بينها.
البيانات الوصفية للأعمال أو البيانات الوصفية الدلالية هي الطبقة الأقل قابلية للاستخراج والأكثر قيمة. إنها تجيب على الأسئلة التي لا تستطيع البيانات الوصفية التقنية الإجابة عليها: ما الذي TRANS-AMT-CD ماذا تعني هذه المصطلحات فعلياً في سياق الأعمال؟ ما هي القيم الصحيحة لـ ACCT-TYPE-CD وماذا يُمثل كل قيمة؟ وما هي قاعدة العمل التي تُحدد متى CUST-STATUS-FLG انتقالات من A إلى Iتوجد هذه الطبقة، إن وجدت أصلاً، في وثائق المواصفات، وفي ذاكرة المطورين، وفي المعرفة المؤسسية التي يحتفظ بها الموظفون الذين ربما تقاعدوا، وفي المنطق الإجرائي للبرامج التي تفرض قواعد العمل من خلال عبارات IF وكتل EVALUATE بدلاً من قيود قاعدة البيانات.
يكمن التحدي الذي يواجه أنظمة متعددة العقود في إدارة البيانات الوصفية في اختلاف أساليب إدارة هذه الطبقات الثلاث، أو عدم إدارتها على الإطلاق، عبر عقود من تطور النظام. فقد تم تسجيل البيانات الوصفية التقنية في شفرة المصدر، لكنها لم تُصاغ رسميًا في قاموس بيانات. أما البيانات الوصفية التشغيلية، فكانت ضمنية في مسارات عمل JCL، لكنها لم تُوثق كسجل نسب. في حين تم توثيق البيانات الوصفية التجارية في المواصفات عند بدء التطوير، ولم يتم تحديثها مع تطور الأنظمة.
مشكلة انحراف البيانات الوصفية
في كل عام، ومع استمرار تشغيل نظام يمتد لعقود دون إدارة منهجية للبيانات الوصفية، تتسع الفجوة بين البيانات الوصفية الموجودة في الوثائق الرسمية والبيانات الوصفية التي تعكس السلوك الفعلي الحالي للنظام. ويحدث هذا الانحراف من خلال أربع آليات:
المجال يعني التطور. إن مجالاً تم تعريفه بمعنى تجاري واحد في عام 1978 قد يكون قد اكتسب معاني إضافية على مدى العقود اللاحقة. ACCT-TYPE-CD ربما كان هذا النظام يميز في الأصل بين الحسابات الجارية وحسابات التوفير. على مدى أربعين عامًا، ربما أُضيفت رموز أخرى لتمثيل حسابات سوق المال، وشهادات الإيداع، وحسابات التقاعد الفردية، وحسابات الضمان، وقد وُثِّقت كل إضافة فقط في كود البرنامج الذي يتعامل مع قيمة الرمز الجديد، وليس في أي تعريف مركزي للحقل. اسم الحقل ونوعه لم يتغيرا؛ لكن معناه الدلالي أصبح أكثر تعقيدًا بشكل ملحوظ.
إعادة استخدام صامتة. أحيانًا يُعاد استخدام الحقول لأغراض أخرى دون تغيير أسمائها. يصبح من غير الملائم توسيع حقل كان يُستخدم لغرض معين، فيستخدم المطور قيمة غير مستخدمة سابقًا لحقل علامة مجاور لترميز معلومة مختلفة. TRANS-FLAG-1 قد يُشفّر الحقل الآن ثلاثة مفاهيم مختلفة عبر سياقات برمجية متباينة، ولا يمكن تمييزها إلا بفحص البرامج التي تقرأ الحقل والظروف التي تقرأه فيها. ولا تُشير البيانات الوصفية التقنية، كاسم الحقل ونوعه وطوله، إلى أن الحقل مُحمّل دلاليًا بشكل زائد.
تُعيد عبارات REDEFINES تعريف التراكم. وكما نوقش في سياقات تحليل VSAM، فإنها تُغطي نفس وحدة التخزين الفعلية بتفسيرات مختلفة للحقول. وقد أُضيفت كل صيغة من صيغ REDEFINES في مرحلة مختلفة من تاريخ النظام، من قِبل مطورين مختلفين، ولأغراض تجارية مختلفة. ولا يُمكن إعادة بناء المعنى الدلالي الكامل لتسلسل REDEFINES الهرمي، وتحديد الصيغة المُطبقة ومتى، ومعنى حقول كل صيغة، إلا من خلال تحليل جميع البرامج التي تصل إلى كل صيغة والظروف التي يتم بموجبها ذلك.
تباين ملفات النسخ. عند تعديل ملف نسخ COBOL قياسي لتلبية متطلبات جديدة، قد تتصرف البرامج التي تتضمن هذا الملف ولم تُحدَّث لمعالجة الحقل الجديد بشكل غير صحيح، أو قد تتجاهله تمامًا. على مرّ عقود من التطوير، قد توجد نسخ متعددة لما يُفترض أنه نفس ملف النسخ في مكتبات مختلفة، وتستخدم برامج مختلفة نسخًا مختلفة. قد تختلف البيانات الوصفية لحقل مُعرَّف في ملف النسخ بين البرامج، وذلك تبعًا لنسخة ملف النسخ التي يتضمنها كل برنامج.
ما لا تستطيع أدوات البيانات الوصفية الحديثة فعله للبيانات القديمة
لقد شهد سوق فهارس بيانات المؤسسات نضجًا ملحوظًا. تُعدّ منصات Collibra وAlation وAtlan وMicrosoft Purview وInformatica Axon منصات متطورة لإدارة البيانات الوصفية في بيئات البيانات الحديثة. وتتميز هذه المنصات بقدرتها على: الاكتشاف التلقائي للمخططات من قواعد البيانات المتصلة، وتتبع مسار البيانات على مستوى الأعمدة عبر مسارات ETL، والحفاظ على قواميس المصطلحات التجارية مع تعريفات مُدققة، وعرض مقاييس جودة البيانات جنبًا إلى جنب مع سجلات البيانات الوصفية.
ما لا تستطيع هذه الأدوات فعله لأنظمة COBOL وأنظمة الحواسيب المركزية التي تعمل منذ عقود:
لا يمكنهم الاتصال بما لا يرونه. تكتشف الفهارس الحديثة البيانات الوصفية من خلال الموصلات، واتصالات JDBC بقواعد البيانات، وتكاملات واجهة برمجة التطبيقات مع الخدمات السحابية، وتكاملات الماسحات الضوئية مع المنصات المدعومة. لا تحتوي ملفات VSAM وبرامج COBOL وتدفقات مهام JCL على موصلات فهرس قياسية. لا يستطيع الفهرس اكتشاف ما لا يملك آلية للوصول إليه. البيانات التي تديرها هذه الأنظمة غير مرئية فعليًا للفهرس، مما يعني أن سجلات النسب لتحليلات السحابة اللاحقة المستمدة من هذه البيانات غير مكتملة أو غائبة.
لا يمكنهم استخراج البيانات الوصفية الموجودة فقط في الشيفرة البرمجية. يستطيع فهرس البيانات المتصل بقاعدة بيانات DB2 قراءة مخطط قاعدة البيانات، وتعريفات الجداول، وأسماء الأعمدة، وأنواع البيانات، والفهارس. لكنه لا يستطيع قراءة برنامج COBOL الذي يُنشئ جدول DB2 لفهم قواعد العمل التي تحكم عملية الإنشاء، أو متغيرات REDEFINES الموجودة في سجل المصدر، أو أسماء الشروط ذات المستوى 88 التي تُحدد الصلاحية الدلالية لكل حقل. تتطلب البيانات الوصفية على مستوى الشيفرة البرمجية، وهي الطبقة التي يكمن فيها المعنى الحقيقي لبيانات الأعمال القديمة، تحليل الشيفرة البرمجية، وليس مسح الفهرس.
لا يمكنهم استعادة المعنى الذي لم يُسجّل أصلًا. حتى مع استخراج البيانات الوصفية التقنية بدقة متناهية، لا يمكن استعادة المعنى التجاري للحقول التي لم تُوثّق رسميًا تلقائيًا. تتطلب هذه الطبقة مزيجًا من تحليل الشفرة (لكشف قواعد العمل التي تُطبّقها البرامج على البيانات، والتي تُمثّل المعنى التجاري) والمراجعة البشرية (للتحقق من صحة المعنى المُستعاد في ضوء المعرفة المؤسسية ما دامت تلك المعرفة قائمة).
نهج إعادة بناء البيانات الوصفية
بالنسبة للأنظمة التي تمتد لعقود طويلة والتي لم تُجمع بياناتها الوصفية الرسمية مطلقًا أو انحرفت بشكل كبير عن الواقع الحالي، تتطلب إدارة البيانات الوصفية مرحلة إعادة بناء قبل مرحلة الحوكمة. يستخلص نهج إعادة البناء الطبقات القابلة للاسترداد ويحدد الثغرات التي تتطلب خبرة بشرية.
المرحلة الأولى: استخراج البيانات الوصفية التقنية من القطع الأثرية المصدرية.
قم بتحليل كل إدخال COBOL FD، وعضو COPY، وعبارة SELECT، وبيان JCL DD لإنتاج جرد بيانات وصفية فنية على مستوى الحقل:
كوبول
* Source FD entry -- technical metadata extraction target
FD TRANSACTION-FILE
LABEL RECORDS ARE STANDARD
RECORD CONTAINS 200 CHARACTERS.
01 TRANSACTION-RECORD.
05 TRANS-DATE PIC 9(8). *> YYYYMMDD format
05 TRANS-TYPE-CD PIC XX. *> See 88-level values
88 TRANS-PAYMENT VALUE 'PM'.
88 TRANS-REFUND VALUE 'RF'.
88 TRANS-ADJUSTMENT VALUE 'AJ'.
88 TRANS-REVERSAL VALUE 'RV'.
05 TRANS-AMT-CD PIC S9(9)V99 COMP-3.
05 TRANS-CURRENCY-CD PIC X(3). *> ISO 4217
05 TRANS-DETAIL REDEFINES TRANS-TYPE-CD.
10 TRANS-MERCH-ID PIC X(12).
10 TRANS-AUTH-CD PIC X(6).
10 FILLER PIC X(84).
من خلال إدخال FD واحد، ينتج عن استخراج البيانات الوصفية التقنية ما يلي: أسماء الحقول، وأنواع البيانات، والأطوال، والمواقع، ودقة الأرقام العشرية المضغوطة لـ TRANS-AMT-CD (9 أرقام، منزلتان عشريتان، مع الإشارة)، القيم الدلالية الأربع لـ TRANS-TYPE-CD كما هو محدد بواسطة أسماء الشروط ذات المستوى 88، وبنية REDEFINES التي تُنشئ تفسيرين متداخلين للبايتات من 10 إلى 105 من السجل.
تُعد أسماء الحالات ذات المستوى 88 ذات قيمة خاصة كبيانات وصفية: TRANS-PAYMENT, TRANS-REFUND, TRANS-ADJUSTMENT, TRANS-REVERSAL هناك أربعة عناصر من مصطلحات الأعمال التي يوفرها كود COBOL نفسه، وهي أكثر دلالة من المصطلحات الأساسية. PM, RF, AJ, RV القيم التي سيراها فهرس البيانات الذي يقوم بمسح قاعدة البيانات.
المرحلة الثانية: استخراج البيانات الوصفية التشغيلية من تبعيات البرنامج.
قم ببناء خريطة النسب التشغيلية من خلال تتبع تدفقات البيانات عبر مخطط تبعية البرنامج:
- ما هي البرامج التي تكتب إلى
TRANSACTION-FILE(المنتجين) - أي البرامج تقرأ من
TRANSACTION-FILE(المستهلكون) - ما هي خطوات وظيفة JCL التي تستدعي كل منتج ومستهلك، وبأي تسلسل؟
- ما هي مجموعات البيانات وقواعد البيانات التي تستقبل البيانات المحولة من
TRANSACTION-FILE
تُعد خريطة النسب هذه بمثابة البيانات الوصفية التشغيلية التي تحتاجها أدوات فهرسة البيانات لتصور النسب، ولكن لا يمكنها إنشاؤها بدون الوصول إلى كود البرنامج المصدر وJCL.
المرحلة الثالثة: استخراج قواعد العمل كوكيل للبيانات الوصفية الدلالية.
تُعد قواعد العمل المُشفّرة في منطق قسم الإجراءات في لغة كوبول بمثابة بدائل للمعنى التجاري. برنامج يقوم بالتحقق من صحة TRANS-AMT-CD لضمان وقوعها ضمن نطاقات معينة قبل المعالجة، يتم تقديم دليل على النطاق الصحيح للحقل. برنامج يقوم بالتحويل TRANS-AMT-CD إن استخدام وحدة مختلفة قبل الكتابة إلى نظام لاحق يكشف عن اتفاقية ضمنية للوحدات العشرية أو الوحدات.
يُنتج استخلاص قواعد العمل هذه من خلال تحليل الشفرة مجموعة من البيانات الوصفية الدلالية المستنتجة: نطاقات التحقق المطبقة على كل حقل، والتحويلات التي تحدث بين المصدر والهدف، والشروط التي تُنفذ بموجبها مسارات الشفرة المختلفة. هذه البيانات الوصفية الدلالية المستنتجة غير دقيقة، فهي تُظهر ما تفعله البرامج بالبيانات، وليس بالضرورة ما كان يُقصد أن تعنيه البيانات، ولكن يمكن استخلاصها من الشفرة بطريقة لا يُمكن استخلاصها من وثيقة المواصفات الأصلية.
المرحلة الرابعة: التحقق البشري والإثراء الدلالي.
تشكل البيانات الوصفية التقنية والتشغيلية المستخرجة والبيانات الوصفية الدلالية المستنتجة أساسًا لجلسات التحقق البشري مع خبراء المجال والمطورين المتقاعدين. والهدف هو تحويل الدلالات المستنتجة إلى دلالات مؤكدة، والتحقق من ذلك. TRANS-AMT-CD يعني ما يشير إليه الكود، وتحديد الحالات التي لم يعد فيها سلوك الكود يعكس المعنى المقصود للأعمال، والتقاط المعرفة المؤسسية حول تاريخ المجال التي لا يمكن لتحليل الكود استعادتها.
هذه المرحلة محددة زمنياً بتوافر الخبرة في المجال: فكل عام يمر، يتقاعد المزيد من هذه المعرفة مع الأشخاص الذين يمتلكونها.
فجوة البيانات الوصفية القديمة عند حدود النظام الحديث
إن نقص البيانات الوصفية الناتج عن الأنظمة القديمة التي تمتد لعقود لا يقتصر على بيئة الأنظمة القديمة فحسب، بل ينتشر إلى الأنظمة اللاحقة: فكل نظام تحليلي، ومستودع بيانات، ومسار تعلم آلي يستهلك البيانات من الأنظمة القديمة يرث فجوة البيانات الوصفية.
يحتوي مستودع بيانات سحابي يستقبل مستخرجًا من ملف مسطح يوميًا من برنامج دفعي مكتوب بلغة كوبول، على تعريفات للأعمدة تتضمن الأسماء التي اختارها فريق هندسة البيانات عند إنشاء مسار ETL. إذا كان الحقل الأصلي TRANS-AMT-CD وقام مطور ETL بتسمية عمود الهدف transaction_amountيبدو أن مستودع البيانات يحتوي على بيانات وصفية كاملة: اسم العمود، ونوع البيانات، ووصف النشاط التجاري، مُضافة إلى الفهرس. لكن ما لا يسجله الفهرس هو... transaction_amount نشأت من TRANS-AMT-CD in TRANSACTION-FILE، والذي يتم إنتاجه بواسطة برنامج COBOL يسمى TRNSRC01، والذي يتم تشغيله في وظيفة JCL TRANSDAY كل ليلة في الساعة 2 صباحًا، والتي تطبق تحويل عملة محدد تم ترميزه في عام 1987 بناءً على اتفاقية سعر صرف قد تكون أو لا تزال سارية.
يبدو سجل البيانات الوصفية في المراحل اللاحقة مكتملاً. لكن سلسلة النسب منقطعة عند حدود النظام القديم. أي عبء عمل تحليلي أو ذكاء اصطناعي يعتمد على فهم مصدر ومعنى transaction_amount يوجد نقص حيث لم يتم توثيق قصة الأصل الحقيقية لتلك القيمة.
إن استنتاج غارتنر بأن 60% من مشاريع الذكاء الاصطناعي غير المدعومة ببيانات جاهزة للذكاء الاصطناعي سيتم التخلي عنها بحلول عام 2026 هو جزئياً بيان يتعلق بالبيانات الوصفية. نماذج الذكاء الاصطناعي التي تستهلك transaction_amount دون معرفة مصدرها، يتم تدريب النموذج على بيانات مجهولة المصدر، وذلك لعدم معرفته أنها مشتقة من حقل COBOL عشري مضغوط ذي منزلة عشرية ضمنية، ومقومة بعملة ربما تم تحويلها باستخدام اتفاقية سعر صرف عام 1987. لا يستطيع النموذج معرفة ما إذا كان عليه التشكيك في هذا السياق أو التكيف معه، لأن البيانات الوصفية التي من شأنها توضيح ذلك غير موجودة في أي فهرس يمكن للنموذج أو مسار بياناته الوصول إليه.
بناء برنامج لإدارة البيانات الوصفية للأنظمة القديمة
يحتوي برنامج إدارة البيانات الوصفية لأنظمة البيانات متعددة العقود على أربعة مكونات تختلف عن تطبيقات كتالوج بيانات المؤسسة القياسية:
المكون الأول: استخراج بيانات التعريف من شفرة المصدر. قبل أن تتمكن أي أداة فهرسة من إدارة بيانات التعريف القديمة، يجب استخراج هذه البيانات من ملفات المصدر التي توجد بها. يشمل هذا الاستخراج ما يلي: إدخالات FD ودفاتر النسخ (بيانات تعريف تقنية لهياكل البيانات)، وعبارات SELECT (تنظيم الملفات وطريقة الوصول إليها)، وعبارات JCL DD (ارتباطات مجموعات البيانات وخصائص الملفات)، وأسماء الشروط من المستوى 88 (مفردات القيم الدلالية المضمنة في شفرة المصدر). الناتج هو جرد لبيانات التعريف على مستوى الحقول، والذي يمكن تحميله في الفهرس كنقطة انطلاق لإثراء البيانات لأغراض العمل.
المكون الثاني: إعادة بناء مسار البيانات. يجب إعادة بناء مسار البيانات للأنظمة القديمة من خلال تحليل تبعيات البرامج بدلاً من تتبع مسار البيانات باستخدام أدوات استخراج البيانات وتحويلها وتحميلها (ETL). يتتبع مخطط مسار البيانات البيانات من برنامج COBOL الأصلي مروراً ببرامج التحويل الوسيطة وصولاً إلى مستخدميها النهائيين، بما في ذلك عمليات ETL التي تُوصلها إلى أنظمة التحليل الحديثة. تُسد هذه العملية فجوة مسار البيانات عند حدود الأنظمة القديمة، حيث تربط بيانات تعريف أعمدة مستودع البيانات السحابي ببيانات تعريف إدخال COBOL FD من خلال سلسلة موثقة من تبعيات البرامج.
المكون الثالث: الإثراء الدلالي بخبرة المجال. توفر البيانات الوصفية التقنية المستخرجة البنية الأساسية؛ ويتطلب تأكيد المعنى التجاري خبرة متخصصة في المجال. تستخدم عملية الإثراء البيانات الوصفية التقنية كدليل منظم لإجراء مقابلات مع الخبراء: "يُعرَّف هذا الحقل على أنه PIC S9(9)V99 COMP-3تم التحقق من صحته على أنه غير سالب في 14 برنامجًا، ويتم تحويله إلى مقياس مختلف قبل الكتابة إلى قاعدة البيانات النهائية، هل يمكنك تأكيد ما يمثله وماذا يعني التحويل؟ يستخدم هذا النهج المنظم تحليل الشفرة لزيادة قيمة المعلومات لكل تفاعل مع الخبراء إلى أقصى حد، مما يتيح إثراءً أسرع وأكثر اكتمالًا من مراجعات الوثائق غير المنظمة.
المكون الرابع: تكامل الحوكمة مع منصات الفهرسة الحديثة. بعد استخراج البيانات الوصفية القديمة وإعادة بنائها وإثرائها، يجب دمجها مع بنية حوكمة البيانات الوصفية الحديثة. يربط هذا التكامل مخزون البيانات الوصفية القديمة بفهرس بيانات المؤسسة، موفرًا: تتبعًا دقيقًا للبيانات على مستوى الأعمدة من مصدر COBOL إلى وجهة السحابة، ومصطلحات معجمية للأعمال مرتبطة بتعريفات الحقول القديمة، وبيانات وصفية لجودة البيانات لمجموعات البيانات القديمة، والتي تُملأ بنفس إطار الحوكمة المستخدم في بيانات النظام الوصفية الحديثة.
كيفية SMART TS XL يستخرج البيانات الوصفية القديمة
SMART TS XL يتناول المكونين الأولين من برنامج إدارة البيانات الوصفية القديمة، وهما استخراج البيانات الوصفية من التعليمات البرمجية المصدرية وإعادة بناء النسب، من خلال تطبيق التحليل الثابت على مجموعة COBOL وJCL وcopybook الكاملة.
تقوم خاصية تحليل الكود الثابت بتحليل كل مدخل FD، وعضو COPY، وعبارة SELECT، وتعريف المستوى 88 في جميع برامج COBOL، مما ينتج عنه جرد بيانات وصفية تقنية على مستوى الحقل: كل اسم حقل، ونوع بياناته، وطوله، ومواصفات COMP، وعضوية REDEFINES، واسم شرط المستوى 88 في كل برنامج ودفتر نسخ في بيئة العمل. بالنسبة لمجموعة تضم آلاف برامج COBOL، ينتج عن هذا الاستخراج في غضون ساعات جرد البيانات الوصفية التقنية الذي قد يستغرق إعداده يدويًا سنوات، إن أمكن إعداده بالكامل أصلًا.
تُنشئ عملية ربط تبعيات التطبيقات خريطة النسب التشغيلية: كل علاقة بين برنامج ومجموعة بيانات (أي البرامج التي تُنتج أي مجموعات بيانات وأيها تستهلكها)، وكل تبعية بين البرامج (أي البرامج التي تستدعي أي برامج أخرى وما هي البيانات التي تتدفق بينها)، وكل علاقة بين لغة التحكم في الوظائف (JCL) والبرنامج (أي خطوات العمل تستدعي أي برامج وبالترتيب). تُعد خريطة النسب هذه طبقة البيانات الوصفية التشغيلية التي تسد الفجوة بين أنظمة المصدر القديمة وسجلات نسب فهرس البيانات الحديثة.
تقوم إمكانية توسيع JCL بتتبع سلسلة التنفيذ الكاملة لكل مهمة JCL: حل مراجع PROC، وتوسيع المعلمات الرمزية، وبناء البيانات الوصفية التشغيلية الكاملة لإنتاج واستهلاك كل مجموعة بيانات، وسياق الجدولة، والوظائف التابعة، وتسلسل التنفيذ الذي يحدد خصائص التوقيت والحداثة لكل مجموعة بيانات.
تتيح إمكانية البحث المؤسسي إمكانية الاستعلام عن مخزون البيانات الوصفية المستخرجة في جميع أنحاء برنامج إدارة البيانات الوصفية: العثور على كل حقل مُعرَّف كـ COMP-3 (الحقول الحساسة للدقة والتي تتطلب تعيينًا دقيقًا للأهداف)، وكل برنامج يقرأ حقلًا محددًا (تحديد جميع مستخدمي جزء معين من البيانات لتتبع النسب والإثراء الدلالي)، وكل اسم شرط من المستوى 88 الذي يطابق مصطلحًا تجاريًا محددًا (ربط المصطلحات التجارية بتعريفات الحقول التقنية). تدعم إمكانية البحث هذه عملية الإثراء الدلالي، مما يمكّن خبراء المجال من العثور على جميع استخدامات حقل أو قيمة معينة قبل تأكيد معناها التجاري.
بالنسبة للمنظمات التي تدير تحديث التراث برامج، SMART TS XLيوفر استخراج البيانات الوصفية الأساس قبل الترحيل: البيانات الوصفية التقنية على مستوى الحقل التي تحتاجها أدوات الترحيل لربط حقول المصدر بمخططات الهدف، والتسلسل التشغيلي الذي تحتاجه برامج الترحيل لتسلسل عمليات ترحيل مجموعات البيانات بشكل صحيح، والمفردات الدلالية ذات 88 مستوى التي تتيح الربط الدقيق من قيم كود COBOL إلى تعريفات القيود العلائقية.
ضرورة استعادة البيانات الوصفية قبل ضياع المعرفة
تُعاني مشكلة إعادة بناء البيانات الوصفية من أجلٍ مُحدد لا ينطبق على معظم تحديات إدارة البيانات، ألا وهو تقاعد المطورين الذين يمتلكون المعرفة المؤسسية التي لا يُمكن استعادتها من خلال تحليل الشفرة. سيتقاعد ما يقرب من ثلث مبرمجي لغة كوبول بحلول عام 2030. ويبلغ متوسط عمر مهندسي الحواسيب المركزية 58.7 عامًا. كل عام يمر دون استخراج منهجي للبيانات الوصفية وإثرائها الدلالي يُضيّق نطاق إمكانية التحقق البشري من صحة البيانات الوصفية المُستعادة.
يمكن استعادة البيانات الوصفية التقنية، كتعريفات الحقول ومواصفات الأنواع وتبعيات البرنامج وسلسلة البيانات، من شفرة المصدر إلى أجل غير مسمى، طالما بقيت شفرة المصدر موجودة. أما البيانات الوصفية الدلالية، أي معنى كل حقل من الناحية التجارية، والقرارات التاريخية التي استند إليها تصميم الحقول، والاتفاقيات الضمنية التي لا توثقها المواصفات التقنية، فلا يمكن استعادتها إلا من الأشخاص الذين يعرفونها، وفقط طالما بقيت متاحة.
يُنتج برنامج إدارة البيانات الوصفية لأنظمة متعددة العقود، يبدأ بالاستخراج التقني ثم ينتقل إلى الإثراء الدلالي في ظل توفر الخبرة المتخصصة، أساسًا كاملًا وقابلًا للاستعادة للبيانات الوصفية. أما البرنامج نفسه، إذا تم تأجيله إلى ما بعد زوال هذه الخبرة، فيُنتج أساسًا تقنيًا للبيانات الوصفية دقيقًا ولكنه غير مكتمل، صحيحًا فيما يتعلق ببنية البيانات، ولكنه لا يُفصح عن معناها.
البيانات الوصفية هي الخريطة. أنظمةٌ طمستها على مدى عقود.
تبدأ إدارة البيانات للأنظمة الحديثة ببيانات وصفية حديثة ومتاحة وموثقة جزئيًا على الأقل. أما إدارة البيانات للأنظمة التي تمتد لعقود فتبدأ ببيانات وصفية موزعة على آلاف ملفات الشيفرة المصدرية، وموثقة جزئيًا في مواصفات تعود لما قبل الإنترنت، ومحفوظة جزئيًا في ذاكرة المطورين الذين يقتربون من التقاعد.
يمر مسار الانتقال من البيانات المدفونة إلى البيانات الخاضعة للحوكمة عبر مراحل الاستخراج وإعادة البناء والإثراء، بهذا الترتيب. توفر البيانات الوصفية التقنية المستخرجة من شفرة المصدر المخزون الأولي. ويُوفر التسلسل التشغيلي المُعاد بناؤه من تبعيات البرنامج خريطة المصدر. أما الإثراء الدلالي، الذي يتم التحقق منه من خلال الخبرة في المجال، فيُضفي المعنى التجاري الذي يجعل البيانات الوصفية التقنية قابلة للتنفيذ في التحليلات والذكاء الاصطناعي والحوكمة.
تُعد منصات فهرسة البيانات الحديثة وجهةً لهذه البيانات الوصفية، وليست نقطة انطلاقها. قبل أن تتمكن Collibra من إدارتها، وقبل أن تتمكن Alation من فهرستها، وقبل أن يثق بها علماء البيانات، يجب أولاً العثور على البيانات الوصفية التي تحتويها الأنظمة الممتدة لعقود، في مدخلات FD، وفي ملفات النسخ، وفي أسماء الشروط ذات المستوى 88، وفي قواعد العمل المشفرة في أربعين عامًا من منطق قسم الإجراءات.
الخريطة موجودة. كل ما تحتاجه هو أن تُقرأ.