تحلیل

من یک مهندس فناوری اطلاعات هستم که علاقه زیادی به دنیای فناوری اطلاعات، برنامه نویسی، امنیت و شبکه دارم.

Power BI و Azure آینده تحلیل های سازمانی خواهند بود

۵۵۶ بازديد
ترکیب Power BI و خدمات مختلف پردازش اطلاعات Azure و نسل بعدی هوش تجاری و تجزیه و تحلیل کسب و کار را دریافت خواهید کرد.


جای تعجب نیست که بسیاری از خدمات مایکروسافت خود را در Azure ساخته شده است، اما به طور فزاینده مایکروسافت همچنین خدمات Azure را به عنوان راهی برای مشتریان برای گسترش و سفارشی کردن محصولات ارائه می دهد.

هنگامی که از جریان داده ها برای استخراج، تمیز کردن و تبدیل داده هایی که در Power BI بارگذاری می کنید استفاده می کنید، این داده ها در Azure Data Lake ذخیره می شوند. شما همچنین می توانید از آن در Azure Databricks یا برای تجزیه و تحلیل از Azure SQL Data Warehouse استفاده کنید که می توانید از طریق پورتال Azure انجام دهید یا با استفاده از برنامه Power BI Desktop برنامه تعاملی ایجاد کنید.

یادگیری ماشین اتوماتیک در Power BI از ویژگی AutoML از Azure Machine Learning است که به دنبال آن است که شما در حال تلاش برای پیش بینی و چه اطلاعاتی در دسترس شما هستید و از طریق چندین الگوریتم یادگیری ماشین برای کشف بهترین نمره استفاده کنید. یا شما می توانید خدمات Azure Cognitive Services را برای تجزیه و تحلیل داده ها در تصاویر و متن، یا ساخت مدل های یادگیری ماشین خود و اجرای آنها استفاده کنید.

Power BI هم اکنون دارای ویژوالایزرهای هوشمند مبتنی بر AI مانند Key Influencers است که تجزیه و تحلیل آماری مختلف مانند رگرسیون منطقی یا طبقه بندی داده ها را برای استخراج عوامل کلیدی مرتبط با یک نتیجه خاص انجام می دهد. شما فاکتورهایی را که فکر می کنید در تجسم بسیار مهم است را بکشید و Power BI آنها را رتبه بندی می کند. همانطور که فاکتورهای بیشتری را اضافه میکنید که فکر میکنید ممکن است مرتبط باشند یا به یک بخش خاص متصل شوند، مدل را دوباره اجرا میکنیم تا ببینیم آیا اطلاعات بیشتر چیزی جدید نشان میدهد یا خیر.

بنابراین اگر تجزیه و تحلیل می کنید که بازدید کنندگان به هتل شما می آیند تا دوباره بمانند، Key Influencer ممکن است کشوری باشد که از آن می آید. اما اگر بازدید کنندگان را در یک گروه سنی خاص انتخاب کنید، مدل فقط بر روی آن تکه ای از داده ها عمل می کند، جایی که Key Influencer ممکن است این باشد که آیا آنها در رستوران هتل خوردند یا درمان آب آشامیدنی داشتند. اگر به دنبال تاخیر در حمل و نقل هستید، می توانید عوامل دیگری را مطرح کنید که کدام بخش تقسیم را تحویل داده است، چه کارخانه ای از آن آمده است، یا چه منطقه ای از آن فرستاده شده است تا ببینید چه چیزی بیشترین تأثیر را بر چه چیزی وارد می کند و چه چیزی تحویل می شود .

دو تجسم AI جدید وجود دارد. تغییر توزیع به نظر می رسد که چه چیزی یک توزیع داده متفاوت از دیگران است. درخت تقسیم، چندین نمایش داده شده را به مدل Power BI ارسال می کند و سپس آنها را با یکدیگر پیوند می دهد، بنابراین شما می توانید بر روی یک متریک در یک تجسم کلیک کنید تا ببینید چه چیزی پشت سر آن است، و سپس کلیک کردن به سطوح مختلف داده را به عمق درک کنید. به این ترتیب، می توانید ببینید که آیا این 500 فروش در یک شهر توسط یک گروه خاص از مشتریان و یا بسیاری از مشتری های مختلف که هنوز هم چیزی مشترک دارند، هدایت می شود.

همه اینها می توانند به تجسم، داشبورد و ویژگی های Q & A طبیعی زبان که Power BI شناخته شده است، و همچنین گزارش های پینگ پینگ جدید که قبلا SQL Server نیاز داشتند، تغذیه کنند. به عنوان مثال، زمانی که از یادگیری ماشین خودکار استفاده می کنید، پیش بینی برای هر ردیف شامل جزئیات مربوط به پیش بینی می شود، بنابراین شما می توانید توضیح را در یک گزارش ارائه دهید تا مشخص شود که کدام ارقام از چه نوع ارقام استفاده می کنند و چه عوامل دخیل هستند.

جوانب مثبت داده
Power BI راه های مختلفی برای انجام این کار است، بسته به اینکه آیا شما یک دانشمند داده ای هستید که می خواهد کار خود را در دسترس بقیه کسب و کار یا تحلیل گرانی که مایل به استفاده از یادگیری ماشین است، اما مهارت های لازم را نداشته باشد خودشان.

دانشمندان داده می توانند مراحل را به یک جریان داده اضافه کنند تا اطلاعات را از داده های بدون ساختار مانند تصاویر یا متن تویت ها و یا بررسی ها استخراج کنند، با استخراج کلمات کلیدی، تجزیه و تحلیل احساسات یا تشخیص آنچه در یک عکس است. این توسط سرویس های شناختی طراحی شده است، اما بدون مراحل معمول نوشتن کد برای تماس با API - شما می توانید تجزیه و تحلیل تصویر و متن را به جریان داده اضافه کنید.

همانطور که خدمات جدید شناختی بیرون می آیند، Power BI بیشتر از این ویژگی ها را اضافه می کند. آخرین ها استخراج متن از تصاویر، تشخیص دست خط و تشخیص نهاد - نه تنها استخراج کلمات کلیدی، بلکه طبقه بندی آنچه که آنها اشاره می کنند. اگر صاحب هتل هستید که به بررسی در اینترنت میپردازید، شناسایی سازمان میتواند به شما بگوید که آیا «دوچرخه سواری» در یک بررسی به معنای یک مهمان خوشحال است که در سفر دوچرخه سواری ماند یا یک مهمان ناراضی که در مورد دوچرخه سواری تهویه مطبوع شکایت دارد و تمام شب.
اگر شما در حال ساخت مدل های یادگیری ماشین خود در Learning Azure Machine و انتشار آنها به عنوان یک سرویس وب هستید، می توانید تجزیه و تحلیل های Power BI را در سازمان خود بر اساس دسترسی به آنها از طریق پورتال Azure به آنها دسترسی داشته باشید و سپس آنها را نشان می دهند به عنوان مدل آنها می توانند همانند خدمات شناختی استفاده کنند. اگر می خواهید عکس ها را در بررسی های هتل تحلیل کنید، ممکن است نیاز به آموزش یک مدل تشخیص تصویر دلخواه برای درک تصاویری از چیزهایی که در یک هتل پیدا می کنید. عکسهای تهویه مطبوع، لامپهای برق، پنجره ها و آسانسورها در یک بررسی هتل احتمالا یک نشانه بد است، و مدل تشخیص تصویر استاندارد ممکن است آنها را به عنوان اشیاء مهم برجسته نکند.

و اگر شما در حال ساخت مدل یادگیری ماشین خود و با استفاده از پایتون و R برای ادغام آن در Power BI یا با استفاده از AutoML در Power BI برای کشف الگوریتم یادگیری ماشین با داده های خود، شما هم اکنون می توانید آپلود این مدل ها برای آموزش Azure Machine برای مدیریت آنها و یا بیشتر آنها را تنظیم کنید. به این معناست که تحلیلگران کسب و کار در دوره هوش تجاری می توانند از گزینه خودکار استفاده کنند، و اگر مفید باشد دانشمند داده می تواند آن را بیابد و آن را توسعه دهد.

و همه این بینش ها در طیف وسیعی از روش ها استفاده می شود. قدرتمند به عنوان داشبورد تعاملی و تجسم در Power BI، گاهی اوقات که کاربران کسب و کار می خواهند این گزارش آشنا است که آنها می توانند چاپ، خواندن و یا ایمیل به مشتری یا تامین کننده. Power BI در حال حاضر از همان گزارش های صفحه بندی شده با هدر ها و پاورقی ها و طرح های جدول، نمودار یا ماتریس به عنوان SQL Server Reporting Services (با ابزار جدید Report Builder برای ایجاد آنها) پشتیبانی می کند. گزارش های صفحه بندی شده بخشی از Power BI Premium هستند، اما آنها نیز با پایگاه داده Power BI Report Server سازگار هستند.

بنابراین اگر می خواهید تجزیه و تحلیل خود را از سرویس های گزارش دهی SQL Server به Power BI منتقل کنید، می توانید یک سیستم اطلاعات کسب و کار کسب و کار ایجاد کنید که طیف گسترده ای از تجزیه و تحلیل کسب و کار را از گزارشاتی که سازمان شما احتمالا در حال حاضر بستگی دارد، به طور خودکار بینشی در داده هایی پیدا می کند که لزوما ساختار یا عددی نیستند. اگر Power BI به تناسب نیازهای شما متکی باشد، این ایده این است که با Azure به راحتی گسترش یابد تا کاربران کسب و کار بتوانند خودشان را انجام دهند.

زبان برنامه نویسی R یا پایتون؟ کدامیک برای تحلیل داده بهتر هستند؟

۵۸۹ بازديد
بحث در مورد Python در مقابل R در جامعه دانشمند اطلاعات، در اینجا نحوه دو زبان برنامه نویسی مطابقت دارد.

پایتون در مقابل R یک بحث مشترک در بین دانشمندان داده است، زیرا هر دو زبان برای کار داده ها و در میان مهارت های اغلب ذکر شده در پست های شغلی برای موقعیت های داده های علمی مفید هستند. هر زبان مزایا و معایب مختلفی برای کار علمی داده است و باید بسته به کار شما انجام شود.

Norm Matloff، استاد علوم رایانه ای در دانشگاه کالیفرنیا دیویس، برای کمک به دانشمندان داده ها، یک زبان گیتفا را برای هدف قرار دادن برخی از نکات در این بحث نوشت.

Matloff R و Python را در 10 دامنه زیر مقایسه کرد تا تعیین کنند کدام زبان برنامه نویسی بهتر انتخاب شده است:

ظرافت
برنده: دوره آموزشی پایتون
در حالی که این ذهنیت است، پتون در هنگام برنامه نویسی به طور چشمگیری استفاده از پرانتز و پرانتز را کاهش می دهد، و آن را براق تر می کند، Matloff در پست نوشت.

منحنی یادگیری
برنده: R

در حالی که دانشمندان داده ها با پایتون باید بسیاری از مواد را برای شروع به یادگیری، از جمله NumPy، Pandas و matplotlib یاد بگیرند، انواع ماتریس و گرافیک پایه در پایه R ساخته شده است، Matloff نوشت.

وی با افزودن "R"، تازه کار می تواند تجزیه و تحلیل داده ها را در عرض چند دقیقه انجام دهد. "کتابخانه های پایتون می توانند برای پیکربندی، حتی برای سیستم های هوشمندانه، پیکربندی شوند، در حالی که اکثر بسته های R درست از جعبه خارج می شوند."

کتابخانه های موجود
برنده: جفت

شاخص بسته پایتون (PyPI) دارای بیش از 183000 بسته است، در حالی که شبکه جامع R Archive (CRAN) بیش از 12،000 دارد. Matloff نوشت، با این حال، PyPI نسبت به علوم داده بسیار نازک است.

"برای مثال، من یک بار به کد نیاز داشتم تا محاسبات سریع از نزدیکترین همسایگان یک نقطه داده داده شده را انجام دهم. (متاسفم کد را با استفاده از آن برای طبقه بندی انجام دهید)" ماتلوف نوشت. "من توانستم بلافاصله بجای دو بسته برای انجام این کار پیدا کنم. در مقابل، در حال حاضر من سعی کردم نزدیکترین کد همسایه برای پایتون را پیدا کنم و حداقل با جستجوی پرطرفدار من، دستیابی خالی به دست آمد؛ فقط یک پیاده سازی وجود داشت که خود را ساده و سر راست توصیف کرد، هیچ چیز سریع نیست. "

هنگامی که شرایط زیر را در PyPI جستجو می کنید، هیچ چیز نمی آید، Matloff افزود: مدل log-line؛ رگرسیون پواسون؛ متغیرهای ابزار؛ داده های فضایی؛ نرخ خطای خانوادگی.

یادگیری ماشین
برنده: پایتون (اما نه خیلی زیاد)

رشد گسترده پایتون در سال های اخیر بخشی از افزایش یادگیری ماشین و هوش مصنوعی (AI) است. Matloff نوشت: در حالی که دوره Python تعدادی از کتابخانه های دقیق را برای تشخیص تصویر ارائه می دهد، مانند AlexNet، نسخه های R نیز به آسانی قابل توسعه می باشند.

"قدرت کتابخانه های پایتون از تنظیم برخی از عملیات تشخیص تصویر است که می تواند به راحتی در پوشه Reras Keras اجرا شود و از این رو، یک نسخه خالص از TensorFlow می تواند توسعه یابد"، Matloff نوشت. "در همین حال، من می خواهم ادعا کنم که در دسترس بودن بسته های R برای جنگ های تصادفی و تقویت شیب قابل توجه است."

صحت آماری
برنده: R (تا کنون)

متلوف نوشت که متخصصان در یادگیری ماشین که برای پایتون طرفداری می کنند گاهی اوقات درک درستی از مسائل مربوط به آماری دارند. از سوی دیگر، از سوی آمارگیران، برای آمارگیران نوشته شده است.

محاسبات موازی
برنده: جفت

متلوف نوشت: نسخه های پایه R و Python پشتیبانی زیادی برای محاسبات چندگانه ندارند. بسته multiprocessing پایتون یک راه حل خوب برای مسائل دیگر آن نیست، و بسته موازی R نیز نیست.

ماتلوف نوشت: "کتابخانه های خارجی که از محاسبه خوشه پشتیبانی می کنند در هر دو زبان خوب هستند." "در حال حاضر پایتون رابط کاربری بهتر را به GPU ها دارد."

رابط C / C ++
برنده: R (اما نه خیلی زیاد)

متلوف نوشت: Rcpp R یک ابزار قدرتمند برای اتصال R به C / C ++ است. در حالی که پایتون ابزارهایی مانند swig برای انجام این کار دارد، آنقدر قدرتمند نیست و بسته Pybind11 هنوز در حال توسعه است. ماتلوف نوشت: ایده جدید ALTREP R همچنین دارای قابلیت بالقوه برای افزایش عملکرد و قابلیت استفاده است. با این حال، انواع Cython و PyPy از Python گاهی اوقات می تواند نیاز به رابط C / C ++ صریح را حذف کند.

جهت گیری شی، metaprogramming
برنده: R (اما نه خیلی زیاد)

ماتلوف نوشت، اگرچه توابع اشیا در هر دو R و Python هستند، R آن را جدی تر می گیرد.

او گفت: "هر زمان که من در پایتون کار می کنم، من از این واقعیت که من نمی توانم یک تابع را به ترمینال، که من در R بسیار کار می کنم، ناراحت هستم." پایتون تنها یک پارادایم OOP دارد. در R، شما انتخاب خود را از چند، هر چند برخی ممکن است بحث که این خوب است. با توجه به ویژگی های متالورژیم جادویی R (کد تولید کد)، دانشمندان کامپیوتر باید روی R قرار بگیرند. "

اتحاد زبان
برنده: پایتون (تا کنون)

در حالی که پایتون از نسخه 2.7 به 3.x منتقل می شود، این باعث ایجاد اختلال زیادی نمی شود. با این حال، متولف نوشت: R به دلیل تاثیرات RStudio: R و Tidyverse به دو گویش متفاوت تبدیل شده است.
ماتلوف نوشت: "شاید بهتر باشد اگر Tidyverse برتر از R معمولی باشد، اما به نظر من این نیست." "این باعث می شود همه چیز برای مبتدیان مشکل تر است."

ساختارهای داده مرتبط هستند
برنده: پایتون (به احتمال زیاد)

ماتلوف نوشت: "ساختار داده های کلاسیک علوم رایانه، مانند درخت های باینری، در پیونس آسان است." "در حالی که این را می توان در R با استفاده از کلاس" لیست "خود انجام داد، می توان حدس زد که آن آهسته است."

طبق یک گزارش آکادمی ابر 2018، هنگامی که به پست های کاری می آید، تقاضا برای مهندسان داده با R در مقایسه با افرادی که در پایتون مهارت دارند، کم است. تقریبا 66٪ از پست های پست شده توسط مهندسین داده مربوط به پایتون بوده است، در مقایسه با فقط 18٪ از پست هایی که اشاره کردید.

طبق گفته Cloud Academy، خارج از R و Python، دیگر مهارت های درخواستی برای مهندسان داده شامل SQL، Spark، Hadoop، Java، Amazon Web Services (AWS)، Scala و کافکا هستند.

کدهای CSS می‌توانند بدون جاوا اسکریپت موس کاربر را دنبال کنند

۵۳۰ بازديد
یک محقق امنیتی راه جدیدی را برای ردیابی حرکات موشهای بازدیدکنندگان وب حتی زمانی که از بلوک کننده های تبلیغاتی یا افزونه هایی استفاده می کنند که جاوا اسکریپت را مسدود می کنند، نشان داده است.

همانطور که در Davy Wybiral در توییتر توضیح داده شده است و در گفتگو با Bleeping Computer این کار با بهره برداری از اثر شناور CSS انجام می شود که می تواند برای فعال سازی یک اثر بصری در هنگام مواجهه با ماوس کاربر بر روی آن استفاده شود. اگر این اثر بصری برای بارگذاری تصاویر از یک سرور از راه دور استفاده شود، متوجه شد که می تواند از آن برای ردیابی حرکت استفاده کند:

برای من اتفاق افتاد که شما می توانید با استفاده از برخی از CSS مکان یابی مکان یاب بدون جاوا اسکریپت را کنترل کنید: انتخابگرها را برای تغییر تصاویر پس زمینه پنهان (باعث ایجاد یک درخواست GET) می شود.

همانطور که ماوس در قسمت های مختلف یک شبکه HTML نامرئی روی صفحه حرکت می کند، تصاویر پس زمینه های مختلف از سرور درخواست می شود. مالک سرور می تواند به نام تصاویر درخواست شده نگاه کند و آنها را به قسمت های مختلف شبکه نشان دهد تا ببیند که چگونه ماوس کاربر روی صفحه حرکت می کند.

تصاویر پس زمینه به کاربر نهایی نشان داده نمی شود، و آنها را از ردیابی ماوس بی اطلاع می کند. Wybiral معتقد است که حتی باید در برابر مرور حریم خصوصی با تمرکز حریم خصوصی کار کرد. استفاده از آن کاملا به سادگی نیست. با این حال:

مرورگر تصویر پس زمینه را بارگیری نمی کند بنابراین این نسخه فقط حرکت را در ابتدا پیگیری می کند: شناور [در هر عنصر شبکه] ... اما ... از آنجا که درخواست متوقف می شود، سرور می تواند CSS بیشتری برای اضافه کردن جدید ارسال کند: هرکدام را انتخاب کنید زمان شروع می شود

در نسخه ی نمایشی، این حتی می تواند در زمان واقعی استفاده شود. چرا یک تبلیغ کننده مراقبت می کند؟ از آنجا که حرکات ماوس به آنها می گوید که کاربران چه میزان در صفحات علاقه دارند، از جمله اینکه چه مدت زمان لازم برای انجام اعمال مانند پیمایش را در عناصر مختلف صرف می کنند.

علاوه بر این،: شناور تنها انتخابگر CSS نیست که می تواند به این روش مورد استفاده قرار گیرد: تمرکز یکی دیگر از احتمالات، او گفت.

تکنیک جذاب است زیرا HTML و CSS (Cascading Style Sheets) زبان های برنامه نویسی نیستند و معمولا در مکالمات مربوط به ردیابی نیستند. ترفندهای فانتزی، تعامل و برنامه نویسی که صفحات وب استاتیک را به برنامه تبدیل می کند دامنه سومین زبان اصلی وب، جاوا اسکریپت است.

این جاوا اسکریپت را در خط اول ردیابی قرار می دهد، به همین دلیل است که adblockers و پلاگین های حریم خصوصی گزینه ای را برای رفع برخی از عناصر صفحه فراهم می کنند.

تکنیک Wybiral مانند یک نسخه تبلیغی گرا از مفهوم فرضیه (ما امیدواریم) استفاده از کلمات عبور Keylogging با استفاده از CSS، یک ایده دیگر است که انجام دور.

در ابتدا، به نظر می رسد تلاش زیادی برای ضبط داده ها در این راه است و هنوز هم نیاز به تفسیر دارد. همچنین در کد منبع بسیار آسان است. اما این حقیقت که میتواند مسدود کنندههای امروز را دور بزند، ممکن است به آن پاها بدهد.

به همین ترتیب، صاحبان وب سایت ها در حال حاضر بسیاری از راه های ایجاد شده برای ردیابی کاربران دارند که احتیاج به اختراع جدیدی ندارند.